Skip to content

Comment trouver la première version d'une page web

Trouvez l'état archivé le plus ancien d'une page, testez les variantes d'URL et les redirections, et distinguez la première capture trouvée de la vraie date de publication.

Réponse rapide

Réponse rapide à Comment trouver la première version d'une page web

Enregistrez la page actuelle, l'URL finale, l'URL canonique et toutes les variantes historiques justifiées. Vérifiez chaque URL exacte dans la Wayback Machine, confirmez la capture la plus ancienne utilisable, puis recherchez dans les anciens sitemaps, flux, liens entrants, redirections et un second index de crawl tel que Common Crawl. Décrivez le résultat comme la capture ou date d'existence vérifiée la plus ancienne, et non comme la vraie date de publication sauf si des preuves indépendantes l'établissent.

  • Un horodatage d'archive prouve qu'une version capturée existait à ce moment-là ; il ne prouve pas que la page a été publiée pour la première fois à cette date.
  • Vérifiez les variantes d'URL justifiées et les domaines prédécesseurs car les redirections et migrations peuvent masquer des captures plus anciennes.
  • Utilisez les séquences de captures pour établir une fenêtre de changement, et enregistrez les URL archivées exactes qui l'appuient.

Sujets: Archives web · Wayback Machine · Dates de publication · Vérification des sources

La première version d'une page web se trouve rarement à l'URL actuelle. Les pages déménagent, les domaines changent, les redirections masquent les anciens chemins et les archives ne capturent que certains moments. Une réponse fiable nécessite donc deux choses : une recherche dans l'historique des URL de la page et un enregistrement de ce que prouve exactement la capture la plus ancienne.

La règle centrale est simple : un horodatage d'archive prouve qu'une version a été capturée à ce moment-là. Il ne prouve pas que la page a été publiée pour la première fois à cette date.

Définissez la version que vous cherchez à trouver

« Première version » peut signifier :

  • la première capture archivée de l'URL exacte
  • la première version contenant une affirmation, image, prix ou politique particulière
  • la page avant une correction ou refonte ultérieure
  • l'URL d'origine avant une migration ou redirection
  • la preuve la plus ancienne que la page existait quelque part

Écrivez la question. Si vous devez savoir quand une affirmation est apparue, la première capture de la page peut être sans rapport car l'affirmation aurait pu être ajoutée des années plus tard. Si vous avez besoin de l'article original, une capture ancienne de la page d'accueil ne suffit pas.

Enregistrez la page actuelle et sa famille d'URL

Commencez par la page actuelle avant d'ouvrir une archive. Sauvegardez :

  • l'URL complète, y compris les paramètres de requête significatifs
  • l'URL finale après redirections
  • l'URL canonique déclarée par la page, le cas échéant
  • le titre visible, l'auteur, la date de publication et la date de dernière mise à jour
  • une phrase distinctive du corps du texte
  • les liens vers les versions imprimable, AMP, mobile, linguistique ou syndiquée

Énumérez ensuite les variantes historiques plausibles justifiées par ce que vous pouvez voir :

  • http et https
  • www et sans www
  • anciens et actuels domaines
  • un ancien slug révélé par une redirection
  • formes avec barre oblique finale et pages d'index
  • versions imprimable, AMP, mobile ou basées sur des requêtes liées par le site

Ne générez pas des dizaines de suppositions d'URL aléatoires. Suivez les redirections, balises canoniques, anciens liens internes, sitemaps et entrées de flux. Chaque variante doit avoir une raison d'exister.

Vérifiez l'URL exacte dans la Wayback Machine

Entrez l'URL complète dans la Wayback Machine et choisissez Browse History. Ouvrez la capture disponible la plus ancienne, puis vérifiez la page elle-même :

  1. L'adresse archivée contient-elle l'URL que vous vouliez vérifier ?
  2. Le titre et le corps de la page correspondent-ils au sujet ?
  3. La capture a-t-elle redirigé vers un chemin ou domaine différent ?
  4. Le contenu est-il suffisamment complet pour soutenir votre conclusion ?
  5. Quel horodatage de capture exact apparaît dans l'URL d'archive ?

Enregistrez l'URL archivée stable, pas seulement l'année affichée sur le calendrier. Une capture peut contenir des images manquantes, des ressources rejouées de dates proches ou une redirection plutôt que le corps de la page. Le premier point sur un calendrier est donc un candidat jusqu'à ce que vous l'ouvriez.

Répétez la vérification pour chaque variante d'URL justifiée. Une migration de site peut faire paraître l'adresse actuelle des années plus récente que le même article sur son ancien domaine.

Comparez les captures, pas seulement les dates

Ouvrez la première capture utilisable et les captures suivantes autour de tout changement important. Comparez les champs qui importent pour votre question :

  • titre et signature
  • dates de publication et de mise à jour visibles
  • l'affirmation centrale ou le libellé de la politique
  • images, légendes et crédits
  • prix, noms de produits ou appels à l'action
  • liens sources sortants
  • URL canonique et redirections

Pour un changement conséquent, copiez le passage pertinent dans vos notes et conservez l'URL de capture à côté. Ne dites pas « la page a changé en mars » quand tout ce que vous savez est qu'un libellé apparaît dans une capture de février et un autre dans une capture d'avril. L'intervalle honnête est « après la capture de février et avant la capture d'avril ».

La couverture d'archive est généralement clairsemée. La norme d'archivage web Memento autorise explicitement que la date archivée renvoyée diffère significativement de la date demandée. Un jour manquant n'est pas une preuve que la page n'existait pas ce jour-là.

Quand l'URL exacte n'a pas de capture utile

Élargissez dans un ordre contrôlé.

Vérifiez la liste d'URL archivées du site. La Wayback Machine peut lister les fichiers qu'elle a capturés sous un domaine ou chemin. Recherchez un slug plus ancien, un répertoire basé sur la date, une page imprimable, une pièce jointe ou une page d'index qui renvoie à la cible.

Inspectez les anciens sitemaps et flux. Les sitemaps XML archivés, flux RSS, index d'auteurs, pages de catégories et archives de newsletters préservent souvent l'URL et le titre d'origine même lorsque l'article lui-même a été manqué.

Recherchez le titre exact ou une phrase rare. Un texte entre guillemets peut révéler une copie syndiquée, citation, lien de forum ou miroir de flux. Une page datée indépendamment qui renvoie à la cible prouve que la cible existait au plus tard à cette date, même si la cible n'a pas été capturée.

Vérifiez un autre index web. Common Crawl fournit un index d'URL CDX public à travers ses collections de crawl. Recherchez l'URL exacte ou un motif d'URL restreint. Un enregistrement peut révéler qu'un crawler a vu une URL dans un crawl particulier et peut fournir l'emplacement de réponse stocké. C'est une seconde source de couverture, pas une preuve qu'aucune page antérieure n'existait.

Suivez les redirections à rebours. Recherchez l'ancien domaine, titre, page d'auteur et liens entrants. Les cartes de migration révèlent parfois l'URL prédécesseur plus clairement que ne le fait le site actuel.

Traitez les dates de page comme des affirmations à vérifier

Une date « Publié » visible, une date de données structurées, un en-tête HTTP Last-Modified ou une date dans une URL peuvent aider, mais aucune ne prouve à elle seule la première publication. Les migrations de systèmes de gestion de contenu peuvent réinitialiser les champs. Les éditeurs peuvent les antidater ou les corriger. Les serveurs génèrent souvent Last-Modified à partir du comportement de déploiement ou de cache.

Privilégiez l'accord indépendant :

  • la date de publication propre à la page
  • une capture d'archive à cette date ou peu après
  • une entrée de flux ou sitemap datée
  • un lien contemporain depuis un autre site
  • un index d'auteur, de numéro ou de catégorie contenant la page

Si trois enregistrements concordent et que rien d'antérieur ne les contredit, vous pouvez rapporter une fenêtre de publication bien étayée. Conservez les preuves attachées à la conclusion.

Tenez un journal de preuves

Un petit tableau empêche les dates de se transformer en suppositions :

PreuveHorodatageCe qu'elle prouveLimitation
URL de page archivéeHeure de captureCette version existait au moment de la captureElle peut avoir existé plus tôt
Entrée de flux datéeDate du fluxLe site listait l'URL à cette dateLes dates de flux peuvent être migrées
Lien entrant indépendantDate de publicationUne autre page y faisait référence à cette dateLa date de la page liante nécessite aussi vérification
Métadonnées de page actuelleDate visible ou machineCe que le site actuel affirmeElle peut être modifiée ou réinitialisée

Pour chaque élément, enregistrez l'URL exacte, l'horodatage, le titre de la page, le texte pertinent et la date à laquelle vous y avez accédé. Si le résultat importe légalement ou professionnellement, conservez des captures d'écran ou fichiers selon les règles de preuve qui s'appliquent à votre travail ; ne comptez pas sur la disponibilité continue d'un onglet de navigateur.

Préservez la page actuelle sans réécrire l'histoire

Si la page en ligne est importante et n'a pas de capture actuelle, Save Page Now de la Wayback Machine peut en créer une. Internet Archive indique que cela sauvegarde la seule page entrée et renvoie une URL permanente ; cela ne crawle pas l'ensemble du site ni ses liens sortants.

Cette nouvelle capture préserve la page à partir de maintenant. Elle ne comble pas le vide dans le passé, et elle ne doit jamais être présentée comme preuve de ce que la page contenait avant l'heure de capture.

Énoncez la conclusion avec précision

Utilisez un langage qui expose l'incertitude restante :

  • Version archivée la plus ancienne trouvée : la capture utilisable la plus ancienne localisée pour la famille d'URL vérifiée.
  • Affirmation présente avant : la première capture dans laquelle le texte pertinent apparaît.
  • Fenêtre de publication : après la dernière capture sans le contenu et avant la première capture avec celui-ci.
  • Existence vérifiée indépendamment la plus ancienne : une archive, flux ou lien entrant établit que la page existait à cette date.
  • Non résolu : la couverture d'archive ou l'historique d'URL est insuffisant.

Ne convertissez jamais « l'archive n'a rien d'antérieur » en « rien d'antérieur n'existait ». La protection par mot de passe, les exclusions de crawlers, les pages non liées, le contenu rendu par script, les échecs de crawl, les suppressions et la simple malchance créent tous des lacunes.

Si la page contient une photo ou vidéo dont l'origine propre est en question, continuez avec comment trouver la source originale d'une photo ou vidéo.

Continuer la lecture