Le lien que tu avais mis en favori renvoie une erreur 404. La page que tu consultais la semaine dernière n'est plus en ligne, alors que rien n'a bougé de ton côté. On met ça sur le compte de la malchance ou d'un site mal fichu. En réalité, c'est la norme : le web perd ses contenus en permanence, et c'est documenté.

La disparition n'est pas une impression : elle est mesurée
Le Pew Research Center a publié en 2024 une étude sur la longévité des pages web. Le constat est brutal : 25 % de toutes les pages collectées entre 2013 et 2023 n'étaient plus accessibles en octobre 2023. Plus on remonte dans le temps, plus les pertes sont lourdes. Sur les pages qui existaient en 2013, 38 % avaient disparu dix ans plus tard.
Le phénomène touche aussi les réseaux sociaux. Dans la même étude, environ 18 % des tweets de la fenêtre de collecte initiale n'étaient plus visibles publiquement trois mois après. "À la fin de la période d'observation, nous avons constaté que 18 % des tweets de notre fenêtre de collecte initiale n'étaient plus visibles publiquement sur le site", explique Athena Chapekis, autrice de l'étude. La cause principale n'est pas un bug : dans la plupart des cas, le compte qui avait publié le tweet était devenu privé, suspendu ou supprimé.
Les dégâts ne s'arrêtent pas aux pages elles-mêmes. 23 % des pages de sites d'actualité échantillonnées contenaient au moins un lien rompu, et 21 % des pages de sites gouvernementaux étaient dans le même cas. Même Wikipédia, qui se veut une référence pérenne, perd des sources : 11 % des références citées dans l'encyclopédie n'étaient plus accessibles.
D'autres travaux vont dans le même sens. Une analyse d'Ahrefs datée de 2024 conclut qu'au moins 66,5 % des liens pointant vers les sites web échantillonnés depuis janvier 2013 sont morts. On parle de plus de deux millions de domaines suivis. Autrement dit, ce n'est pas une poignée de pages oubliées : c'est une fraction massive du web qui se décompose en continu.
Pourquoi les pages disparaissent
Les causes sont moins mystérieuses qu'il n'y paraît. La censure, les problèmes techniques et le non-renouvellement des serveurs figurent parmi les mécanismes identifiés. Une page hébergée sur un serveur qu'on arrête de payer disparaît, même si personne n'a décidé de la supprimer. Un changement d'infrastructure peut effacer des années de contenu.
L'exemple de Myspace est resté célèbre : la musique stockée sur la plateforme entre 2003 et 2015 a été perdue, officiellement à cause d'un problème de changement de serveurs. Des années de morceaux et de pages d'artistes, effacées d'un coup, sans que les intéressés y soient pour quoi que ce soit. C'est le scénario type : on ne perd pas son contenu parce qu'on l'a supprimé, on le perd parce que quelqu'un d'autre a arrêté de payer les serveurs.
Le numérique a ce paradoxe : on le croit immatériel, donc éternel, alors qu'il est plus fragile que le papier. Les CD réinscriptibles, par exemple, sont étonnamment exposés à la perte de données, et leur lecture dépend d'un matériel et d'un logiciel compatibles. Un fichier n'existe que tant que quelque chose sait le lire.
Une couche juridique s'ajoute. L'explosion de l'intelligence artificielle est citée comme un nouvel obstacle pour les archives, entre questions de droit d'auteur et techniques de collecte.
Garder une copie soi-même
La bonne nouvelle, c'est qu'on peut agir à son échelle. Pour conserver une page web, il existe plusieurs solutions grand public : l'enregistrer en HTML ou en fichier unique au format .mhtml via l'extension SingleFile, l'imprimer en PDF, ou passer par un service dédié comme Pocket, wallabag ou Raindrop.io.
Pour tes données personnelles, la règle est simple : ne jamais considérer le stockage en ligne comme garanti dans le temps. Mieux vaut conserver une copie physique de tes données les plus sensibles sur une clé USB ou un disque dur, en plus de la version hébergée. Un service cloud peut fermer, changer de modèle ou perdre des fichiers ; ton disque, lui, reste chez toi.
Les archives publiques, et leurs angles morts
Pour archiver une page de façon publique et partageable, les outils ne manquent pas : la fonction "Save Page Now" de la Wayback Machine, archive.today, perma.cc ou megalodon.jp. Le plus connu reste l'Internet Archive, fondé par Brewster Kahle en mai 1996, qui a lancé la Wayback Machine en 2001 et a franchi le seuil des mille milliards de pages archivées en décembre 2024. La fondation ne conserve d'ailleurs pas que des pages web : sa collection comprend aussi des textes, de l'audio, de la vidéo, des images et des logiciels.
Ces archives rattrapent une partie des pertes. Une analyse de l'Internet Archive montre que la Wayback Machine "sauve" environ 15 % des pages jugées mortes par l'étude du Pew Research Center, selon Sawood Alam. C'est utile, mais l'essentiel des pages disparues n'est pas rattrapé pour autant.

Ces services ont leurs limites. La Wayback Machine n'a jamais eu pour objectif de préserver l'intégralité du réseau, et la fondation se conforme parfois aux demandes des détenteurs de droits d'auteur pour exclure certains sites.
Autre évolution, rapportée par une source secondaire : Google a retiré début 2024 les liens directs vers son cache dans les résultats de recherche. Précision : le cache lui-même n'a pas été désactivé, mais retrouver une version sauvegardée d'une page supprimée demande désormais de passer par d'autres outils.
En France, l'État joue aussi ce rôle. Depuis 2006, la Bibliothèque nationale de France est chargée de collecter et conserver l'Internet français au titre du dépôt légal numérique. Mais ces collections, soumises au droit d'auteur, ne sont consultables que dans les salles de la Bibliothèque de recherche de la BnF et dans une vingtaine de bibliothèques régionales. La préservation existe, mais l'accès reste verrouillé. Le dépôt légal, inscrit dans le Code du patrimoine, permet aussi à l'INA de constituer une collection de référence, notamment pour l'audiovisuel.
L'Internet Archive, lui, navigue en eaux juridiques agitées : la fondation doit composer avec des détenteurs de droits d'auteur qui contestent une partie de ses pratiques de diffusion.
La conservation est un travail continu
Préserver le numérique n'est pas une action ponctuelle. C'est une série d'actions continues dans le temps, parce que les formats, les matériels et les logiciels évoluent et peuvent rendre un contenu illisible même quand le fichier est toujours là. Un disque dur qui dort dix ans n'est pas une archive, c'est une promesse qu'on n'a pas vérifiée.
La disparition en ligne est mesurable, et elle est en partie réversible. Ce qui reste dépend d'un choix délibéré : décider ce qu'on veut garder, et s'en donner les moyens régulièrement.
Questions fréquentes
Quelle part des pages web a disparu ?
Environ 25 % des pages collectées entre 2013 et 2023 n'étaient plus accessibles en octobre 2023, selon l'étude du Pew Research Center publiée en 2024.
Comment conserver une page web soi-même ?
On peut l'enregistrer en HTML ou en fichier unique au format .mhtml via l'extension SingleFile, l'imprimer en PDF, ou passer par un service dédié comme Pocket, wallabag ou Raindrop.io.
Qu'est-ce que la Wayback Machine ?
Un outil de l'Internet Archive lancé en 2001, qui a dépassé mille milliards de pages archivées en décembre 2024.