Skip to content

Come trovare la versione più antica di una pagina web

Trova lo stato archiviato più antico di una pagina, verifica varianti URL e reindirizzamenti, e distingui la prima acquisizione trovata dalla vera data di pubblicazione.

Risposta rapida

Risposta rapida a Come trovare la versione più antica di una pagina web

Registra la pagina corrente, l'URL finale, l'URL canonico e tutte le varianti storiche supportate. Verifica ogni URL esatto nella Wayback Machine, controlla la prima acquisizione utilizzabile, quindi cerca vecchie sitemap, feed, link in entrata, reindirizzamenti e un secondo indice di scansione come Common Crawl. Descrivi il risultato come la prima acquisizione verificata o data di esistenza, non come vera data di pubblicazione a meno che prove indipendenti non la stabiliscano.

  • Un timestamp di archivio prova che una versione acquisita esisteva entro quel momento; non prova che la pagina sia stata pubblicata per la prima volta allora.
  • Verifica varianti URL giustificate e domini predecessori perché reindirizzamenti e migrazioni possono nascondere acquisizioni più vecchie.
  • Usa sequenze di acquisizioni per stabilire una finestra di modifica e registra gli URL archiviati esatti che la supportano.

Argomenti: Archivi web · Wayback Machine · Date di pubblicazione · Verifica delle fonti

La versione più antica di una pagina web raramente si trova all'URL corrente. Le pagine si spostano, i domini cambiano, i reindirizzamenti nascondono vecchi percorsi e gli archivi catturano solo alcuni momenti. Una risposta affidabile richiede quindi due cose: una ricerca nella cronologia degli URL della pagina e una registrazione di ciò che esattamente prova la prima acquisizione.

La regola centrale è semplice: un timestamp di archivio prova che una versione è stata acquisita entro quel momento. Non prova che la pagina sia stata pubblicata per la prima volta allora.

Definisci la versione che stai cercando di trovare

"Versione più antica" può significare:

  • la prima acquisizione archiviata dell'URL esatto
  • la prima versione contenente una particolare affermazione, immagine, prezzo o policy
  • la pagina prima di una successiva correzione o riprogettazione
  • l'URL originale prima di una migrazione o reindirizzamento
  • la prima prova che la pagina esistesse ovunque

Scrivi la domanda. Se devi sapere quando è apparsa un'affermazione, la prima acquisizione della pagina potrebbe essere irrilevante perché l'affermazione potrebbe essere stata aggiunta anni dopo. Se hai bisogno dell'articolo originale, una prima acquisizione della homepage non è sufficiente.

Registra la pagina corrente e la sua famiglia di URL

Inizia con la pagina corrente prima di aprire un archivio. Salva:

  • l'URL completo, inclusi parametri di query significativi
  • l'URL finale dopo i reindirizzamenti
  • l'URL canonico dichiarato dalla pagina, se presente
  • il titolo visibile, autore, data di pubblicazione e data dell'ultimo aggiornamento
  • una frase distintiva dal corpo del testo
  • link a versioni stampabili, AMP, mobile, linguistiche o sindacate

Quindi elenca varianti storiche plausibili supportate da ciò che puoi vedere:

  • http e https
  • www e non-www
  • domini vecchi e attuali
  • uno slug precedente rivelato da un reindirizzamento
  • forme con e senza barra finale e pagine indice
  • versioni stampabili, AMP, mobile o basate su query collegate dal sito

Non generare dozzine di ipotesi URL casuali. Segui reindirizzamenti, tag canonici, vecchi link interni, sitemap e voci di feed. Ogni variante dovrebbe avere una ragione per esistere.

Verifica l'URL esatto nella Wayback Machine

Inserisci l'URL completo nella Wayback Machine e scegli Browse History. Apri la prima acquisizione disponibile, quindi verifica la pagina stessa:

  1. L'indirizzo archiviato contiene l'URL che intendevi verificare?
  2. Il titolo della pagina e il corpo corrispondono all'argomento?
  3. L'acquisizione ha reindirizzato a un percorso o dominio diverso?
  4. Il contenuto è sufficientemente completo per supportare la tua conclusione?
  5. Quale timestamp esatto di acquisizione appare nell'URL dell'archivio?

Registra l'URL archiviato stabile, non solo l'anno mostrato nel calendario. Un'acquisizione può contenere immagini mancanti, risorse riprodotte da date vicine o un reindirizzamento anziché il corpo della pagina. Il primo punto su un calendario è quindi un candidato finché non lo apri.

Ripeti il controllo per ogni variante URL giustificata. Una migrazione del sito può far sembrare l'indirizzo corrente anni più recente dello stesso articolo al suo vecchio dominio.

Confronta acquisizioni, non solo date

Apri la prima acquisizione utilizzabile e le successive acquisizioni intorno a qualsiasi cambiamento importante. Confronta i campi che contano per la tua domanda:

  • titolo e firma
  • date di pubblicazione e aggiornamento visibili
  • l'affermazione centrale o il linguaggio della policy
  • immagini, didascalie e crediti
  • prezzi, nomi di prodotti o inviti all'azione
  • link in uscita verso fonti
  • URL canonico e reindirizzamenti

Per un cambiamento consequenziale, copia il passaggio rilevante nelle tue note e conserva l'URL di acquisizione accanto. Non dire "la pagina è cambiata a marzo" quando tutto ciò che sai è che una formulazione appare in un'acquisizione di febbraio e un'altra in un'acquisizione di aprile. L'intervallo onesto è "dopo l'acquisizione di febbraio e entro l'acquisizione di aprile".

La copertura archivistica è solitamente scarsa. Lo standard di archiviazione web Memento consente esplicitamente che la data archiviata restituita differisca significativamente dalla data richiesta. Un giorno mancante non è prova che la pagina non esistesse quel giorno.

Quando l'URL esatto non ha acquisizioni utili

Lavora verso l'esterno in ordine controllato.

Verifica l'elenco degli URL archiviati del sito. La Wayback Machine può elencare i file che ha acquisito sotto un dominio o percorso. Cerca uno slug più vecchio, directory basata su date, pagina stampabile, allegato o pagina indice che colleghi al target.

Ispeziona vecchie sitemap e feed. Sitemap XML archiviate, feed RSS, indici autori, pagine di categoria e archivi newsletter spesso preservano l'URL e il titolo originali anche quando l'articolo stesso è stato perso.

Cerca il titolo esatto o una frase rara. Il testo tra virgolette può rivelare una copia sindacata, citazione, link da forum o mirror di feed. Una pagina datata indipendentemente che collega al target prova che il target esisteva non oltre quella data, anche se il target non è stato acquisito.

Verifica un altro indice web. Common Crawl fornisce un indice URL CDX pubblico attraverso le sue collezioni di scansioni. Cerca l'URL esatto o un pattern URL ristretto. Un record può rivelare che un crawler ha visto un URL in una particolare scansione e può fornire la posizione della risposta memorizzata. È una seconda fonte di copertura, non prova che non esistesse una pagina precedente.

Segui i reindirizzamenti all'indietro. Cerca il vecchio dominio, titolo, pagina autore e link in entrata. Le mappe di migrazione a volte rivelano l'URL predecessore più chiaramente di quanto faccia il sito corrente.

Tratta le date delle pagine come affermazioni da verificare

Una data "Pubblicato" visibile, una data nei dati strutturati, un'intestazione HTTP Last-Modified o una data all'interno di un URL possono aiutare, ma nessuna prova da sola la prima pubblicazione. Le migrazioni dei sistemi di gestione dei contenuti possono reimpostare i campi. Gli editori possono retrodatarli o correggerli. I server spesso generano Last-Modified dal comportamento di distribuzione o cache.

Preferisci l'accordo indipendente:

  • la data di pubblicazione propria della pagina
  • un'acquisizione d'archivio in quella data o poco dopo
  • una voce di feed o sitemap datata
  • un link contemporaneo da un altro sito
  • un indice autore, numero o categoria contenente la pagina

Se tre record concordano e nulla di precedente li contraddice, puoi riportare una finestra di pubblicazione ben supportata. Mantieni le prove allegate alla conclusione.

Mantieni un registro delle prove

Una piccola tabella impedisce alle date di trasformarsi in ipotesi:

ProvaTimestampCosa provaLimitazione
URL pagina archiviataTempo di acquisizioneQuesta versione esisteva entro l'acquisizionePotrebbe essere esistita prima
Voce feed datataData feedIl sito elencava l'URL entro questa dataLe date dei feed possono essere migrate
Link in entrata indipendenteData di pubblicazioneUn'altra pagina vi faceva riferimento entro questa dataAnche la data della pagina collegante necessita verifica
Metadati pagina correnteData visibile o automaticaCiò che afferma il sito correntePuò essere modificata o reimpostata

Per ogni elemento, registra l'URL esatto, timestamp, titolo della pagina, testo rilevante e la data in cui vi hai avuto accesso. Se il risultato è importante legalmente o professionalmente, conserva screenshot o file secondo le regole probatorie che si applicano al tuo lavoro; non fare affidamento sul fatto che una scheda del browser rimanga disponibile.

Preserva la pagina corrente senza riscrivere la storia

Se la pagina live è importante e non ha acquisizione corrente, Save Page Now della Wayback Machine può crearne una. Internet Archive afferma che questo salva la singola pagina inserita e restituisce un URL permanente; non esegue la scansione dell'intero sito o dei suoi link in uscita.

Questa nuova acquisizione preserva la pagina da ora in avanti. Non riempie il vuoto nel passato e non deve mai essere presentata come prova di ciò che la pagina conteneva prima del tempo di acquisizione.

Formula la conclusione con precisione

Usa un linguaggio che esponga l'incertezza rimanente:

  • Versione archiviata più antica trovata: l'acquisizione utilizzabile più vecchia localizzata per la famiglia di URL verificata.
  • Affermazione presente entro: la prima acquisizione in cui appare il testo rilevante.
  • Finestra di pubblicazione: dopo l'ultima acquisizione senza il contenuto e entro la prima acquisizione con esso.
  • Prima esistenza verificata indipendentemente: un archivio, feed o link in entrata stabilisce che la pagina esisteva entro questa data.
  • Non risolto: la copertura archivistica o la cronologia URL è insufficiente.

Non convertire mai "l'archivio non ha nulla di precedente" in "non esisteva nulla di precedente". Protezione tramite password, esclusioni crawler, pagine non collegate, contenuti renderizzati tramite script, fallimenti di scansione, rimozioni e semplice sfortuna creano tutti lacune.

Se la pagina contiene una foto o video la cui origine è in questione, continua con come trovare la fonte originale di una foto o video.

Continua a leggere