Préserver le premier Web exige de conserver plusieurs éléments liés : les fichiers des sites, leurs adresses, leurs liens, les logiciels capables de les servir et les conditions dans lesquelles ils étaient consultés. Une page copiée isolément peut rester lisible, mais perdre une grande partie de sa signification. La conservation repose donc autant sur l'archivage technique que sur la documentation des lacunes, des transformations et du contexte d'utilisation.
Pourquoi les premières pages web sont-elles si fragiles ?
Un document imprimé demeure consultable tant que son support reste lisible. Une page web dépend d'un ensemble distribué : serveur, nom de domaine, fichiers, liens, formats et logiciel de lecture. La disparition d'un seul composant peut dégrader l'expérience. Cette vulnérabilité concerne le site associé à l'anniversaire du premier site web, mais aussi d'innombrables pages ultérieures qui n'ont jamais été conçues comme des archives.
Les causes de disparition sont variées : arrêt d'un serveur, changement d'adresse, remplacement d'une page, suppression d'un compte, perte d'un support de stockage ou migration incomplète. Un site peut également rester accessible tout en ayant profondément changé. Son adresse est alors intacte, mais ses textes, sa navigation ou son apparence ne correspondent plus à l'état historique recherché.
Le passage d'un Web encore restreint à un réseau ouvert plus largement accessible, commémoré par l'anniversaire du World Wide Web public, a multiplié les publications et les relations entre documents. Cette croissance a aussi rendu impossible toute conservation automatique et exhaustive.
Archiver une page ne suffit pas à préserver un site
Une capture peut enregistrer le code d'une page sans récupérer toutes ses dépendances. Images, feuilles de style, fichiers téléchargés ou pages liées peuvent résider ailleurs. Même un site textuel dépend de chemins d'accès et de réponses fournies par un serveur. Pour constituer un ensemble exploitable, il faut généralement réunir :
- les fichiers disponibles et leurs différentes versions ;
- les adresses d'origine, redirections et chemins relatifs ;
- les ressources intégrées, notamment images et documents joints ;
- la structure des liens internes et externes ;
- les informations sur le serveur et les logiciels de consultation ;
- la provenance de chaque copie et la date de sa collecte ;
- la liste explicite des éléments absents ou incertains.
Cette approche distingue l'objet conservé de son environnement. Une ancienne page de l'histoire de Wikipédia, par exemple, peut être compréhensible seule, alors que son fonctionnement éditorial dépend aussi des révisions, des discussions et des liens entre articles. De même, conserver un message lié à l'anniversaire du premier tweet ne restitue pas nécessairement son interface, ses réponses ni son contexte de circulation.
Une archive fidèle ne masque pas ses lacunes : elle permet de savoir ce qui est original, restauré, remplacé ou perdu.
Liens rompus et adresses : préserver les relations entre documents
Le lien hypertexte est à la fois une fonction et une trace historique. Il indique qu'un auteur associait deux ressources à un moment donné. Lorsqu'une destination disparaît, le lien rompu conserve encore une information : l'adresse visée, son intitulé et sa place dans le document source.
Remplacer automatiquement tous les liens morts par des destinations actuelles peut donc falsifier le parcours ancien. Une conservation rigoureuse garde l'URL originale et propose, séparément, une copie archivée lorsqu'elle existe. Elle signale aussi les redirections, car une même adresse peut avoir désigné plusieurs contenus au fil du temps.
Les grandes plateformes illustrent une autre difficulté. Les publications associées à l'histoire de Facebook dépendent souvent d'identifiants, de permissions et d'interfaces dynamiques. Leur préservation ne peut pas être réduite à une simple capture visuelle : il faut préciser ce qui était public, ce qui a été collecté et ce qui demeure inaccessible.
Restaurer, reconstruire ou émuler : trois choix différents
La restauration
Restaurer consiste à remettre en service des fichiers authentiques, avec le moins de modifications possible. Les adaptations indispensables, par exemple un nouveau chemin de stockage, doivent être consignées. Cette solution est privilégiée lorsque les sources sont suffisamment complètes et que leur remise en ligne ne crée pas de risque technique.
La reconstruction
Une reconstruction reproduit un état ancien à partir de traces partielles : copies, captures, descriptions ou fichiers retrouvés séparément. Elle peut rendre une expérience intelligible, mais ne doit pas être présentée comme l'original. Les ajouts, hypothèses et substitutions doivent être identifiables.
L'émulation
L'émulation recrée l'environnement nécessaire à l'exécution d'un ancien logiciel. Elle est utile lorsqu'un navigateur, un système ou un format ne fonctionne plus sur les machines actuelles. L'évolution de Firefox et celle évoquée par l'anniversaire de Google Chrome rappellent que le navigateur n'est pas un cadre neutre : son moteur, ses polices et ses règles d'affichage influencent ce que voit l'utilisateur.
Le choix peut suivre une méthode simple :
- définir l'état historique que l'on cherche à représenter ;
- inventorier les fichiers et logiciels réellement disponibles ;
- tester une consultation sans altérer les originaux ;
- choisir la restauration si les sources sont suffisantes ;
- recourir à l'émulation si l'environnement ancien est déterminant ;
- présenter toute reconstruction comme une interprétation documentée.
Documenter une expérience historique sans la falsifier
Une conservation utile doit répondre à des questions simples : que regarde-t-on, de quelle période provient cet état, quels éléments sont authentiques et quelles interventions ont été nécessaires ? Cette notice accompagne l'objet sans se substituer à lui.
Il faut également distinguer l'apparence et le fonctionnement. Une capture d'écran témoigne d'un rendu, mais ne conserve ni les liens actifs ni la réaction du serveur. Une copie navigable préserve certaines interactions, mais son affichage sur un navigateur moderne peut différer. Une vidéo montre un parcours précis, sans permettre d'explorer les autres chemins possibles.
La solution la plus solide combine donc plusieurs traces : fichiers bruts, copie navigable, captures, inventaire des liens, description de l'environnement et journal des interventions. Les originaux sont conservés séparément des versions adaptées. Des empreintes numériques peuvent aider à vérifier qu'un fichier n'a pas été modifié, tandis que des copies sur plusieurs supports réduisent le risque de perte unique.
Enfin, rendre une archive accessible ne signifie pas tout republier sans examen. Droits d'auteur, données personnelles, secrets techniques et sécurité des logiciels anciens peuvent imposer des restrictions. La préservation consiste alors à conserver autant que possible, à ouvrir ce qui peut l'être et à expliquer clairement les limites de consultation.
#LundisNum | 10 avril 2017 - Valérie Schafer : Les archives du Web, patrimoine et histoire
Questions fréquentes
Quelle différence existe-t-il entre une archive web et une capture d'écran ?
Une archive web cherche à conserver les fichiers, les adresses et parfois la navigation d'un site. Une capture d'écran enregistre seulement un rendu visuel à un instant donné. Elle peut montrer une mise en page disparue, mais ne préserve pas les liens, les téléchargements ni les réponses du serveur.
Un site remis en ligne à son ancienne adresse est-il forcément authentique ?
Non. Une adresse historique peut aujourd'hui servir un contenu remplacé, reconstruit ou modifié. L'authenticité doit être établie par la provenance des fichiers, leur comparaison avec des traces contemporaines et la documentation des interventions réalisées.
Pourquoi conserver les liens qui ne fonctionnent plus ?
Un lien rompu reste une trace de la structure documentaire ancienne. Son URL, son libellé et sa position indiquent quelle ressource était recommandée ou citée. Le supprimer efface cette relation ; mieux vaut le conserver et signaler séparément l'existence éventuelle d'une copie archivée.
L'émulation reproduit-elle exactement l'expérience d'origine ?
Pas nécessairement. Elle peut restituer un ancien navigateur ou système avec une grande précision, mais l'écran, les polices, le réseau et les périphériques modernes introduisent encore des différences. Elle constitue une simulation documentée, pas un retour matériel complet à la situation initiale.
Comment signaler les parties reconstruites d'un site historique ?
Il faut distinguer clairement les fichiers originaux, les éléments restaurés et les ajouts hypothétiques. Une notice peut préciser la provenance de chaque composant, les modifications effectuées, les éléments manquants et le degré d'incertitude de la reconstruction.
Pourquoi conserver plusieurs versions d'une même page ?
Une page web peut changer sans que son adresse change. Conserver plusieurs états permet de suivre les corrections, déplacements, suppressions et transformations de navigation. Une version unique risquerait de faire passer un état tardif pour le contenu historique permanent du site.