La versione più antica di una pagina web raramente si trova all'URL corrente. Le pagine si spostano, i domini cambiano, i reindirizzamenti nascondono vecchi percorsi e gli archivi catturano solo alcuni momenti. Una risposta affidabile richiede quindi due cose: una ricerca nella cronologia degli URL della pagina e una registrazione di ciò che esattamente prova la prima acquisizione.
La regola centrale è semplice: un timestamp di archivio prova che una versione è stata acquisita entro quel momento. Non prova che la pagina sia stata pubblicata per la prima volta allora.
Definisci la versione che stai cercando di trovare
"Versione più antica" può significare:
- la prima acquisizione archiviata dell'URL esatto
- la prima versione contenente una particolare affermazione, immagine, prezzo o policy
- la pagina prima di una successiva correzione o riprogettazione
- l'URL originale prima di una migrazione o reindirizzamento
- la prima prova che la pagina esistesse ovunque
Scrivi la domanda. Se devi sapere quando è apparsa un'affermazione, la prima acquisizione della pagina potrebbe essere irrilevante perché l'affermazione potrebbe essere stata aggiunta anni dopo. Se hai bisogno dell'articolo originale, una prima acquisizione della homepage non è sufficiente.
Registra la pagina corrente e la sua famiglia di URL
Inizia con la pagina corrente prima di aprire un archivio. Salva:
- l'URL completo, inclusi parametri di query significativi
- l'URL finale dopo i reindirizzamenti
- l'URL canonico dichiarato dalla pagina, se presente
- il titolo visibile, autore, data di pubblicazione e data dell'ultimo aggiornamento
- una frase distintiva dal corpo del testo
- link a versioni stampabili, AMP, mobile, linguistiche o sindacate
Quindi elenca varianti storiche plausibili supportate da ciò che puoi vedere:
httpehttpswwwe non-www- domini vecchi e attuali
- uno slug precedente rivelato da un reindirizzamento
- forme con e senza barra finale e pagine indice
- versioni stampabili, AMP, mobile o basate su query collegate dal sito
Non generare dozzine di ipotesi URL casuali. Segui reindirizzamenti, tag canonici, vecchi link interni, sitemap e voci di feed. Ogni variante dovrebbe avere una ragione per esistere.
Verifica l'URL esatto nella Wayback Machine
Inserisci l'URL completo nella Wayback Machine e scegli Browse History. Apri la prima acquisizione disponibile, quindi verifica la pagina stessa:
- L'indirizzo archiviato contiene l'URL che intendevi verificare?
- Il titolo della pagina e il corpo corrispondono all'argomento?
- L'acquisizione ha reindirizzato a un percorso o dominio diverso?
- Il contenuto è sufficientemente completo per supportare la tua conclusione?
- Quale timestamp esatto di acquisizione appare nell'URL dell'archivio?
Registra l'URL archiviato stabile, non solo l'anno mostrato nel calendario. Un'acquisizione può contenere immagini mancanti, risorse riprodotte da date vicine o un reindirizzamento anziché il corpo della pagina. Il primo punto su un calendario è quindi un candidato finché non lo apri.
Ripeti il controllo per ogni variante URL giustificata. Una migrazione del sito può far sembrare l'indirizzo corrente anni più recente dello stesso articolo al suo vecchio dominio.
Confronta acquisizioni, non solo date
Apri la prima acquisizione utilizzabile e le successive acquisizioni intorno a qualsiasi cambiamento importante. Confronta i campi che contano per la tua domanda:
- titolo e firma
- date di pubblicazione e aggiornamento visibili
- l'affermazione centrale o il linguaggio della policy
- immagini, didascalie e crediti
- prezzi, nomi di prodotti o inviti all'azione
- link in uscita verso fonti
- URL canonico e reindirizzamenti
Per un cambiamento consequenziale, copia il passaggio rilevante nelle tue note e conserva l'URL di acquisizione accanto. Non dire "la pagina è cambiata a marzo" quando tutto ciò che sai è che una formulazione appare in un'acquisizione di febbraio e un'altra in un'acquisizione di aprile. L'intervallo onesto è "dopo l'acquisizione di febbraio e entro l'acquisizione di aprile".
La copertura archivistica è solitamente scarsa. Lo standard di archiviazione web Memento consente esplicitamente che la data archiviata restituita differisca significativamente dalla data richiesta. Un giorno mancante non è prova che la pagina non esistesse quel giorno.
Quando l'URL esatto non ha acquisizioni utili
Lavora verso l'esterno in ordine controllato.
Verifica l'elenco degli URL archiviati del sito. La Wayback Machine può elencare i file che ha acquisito sotto un dominio o percorso. Cerca uno slug più vecchio, directory basata su date, pagina stampabile, allegato o pagina indice che colleghi al target.
Ispeziona vecchie sitemap e feed. Sitemap XML archiviate, feed RSS, indici autori, pagine di categoria e archivi newsletter spesso preservano l'URL e il titolo originali anche quando l'articolo stesso è stato perso.
Cerca il titolo esatto o una frase rara. Il testo tra virgolette può rivelare una copia sindacata, citazione, link da forum o mirror di feed. Una pagina datata indipendentemente che collega al target prova che il target esisteva non oltre quella data, anche se il target non è stato acquisito.
Verifica un altro indice web. Common Crawl fornisce un indice URL CDX pubblico attraverso le sue collezioni di scansioni. Cerca l'URL esatto o un pattern URL ristretto. Un record può rivelare che un crawler ha visto un URL in una particolare scansione e può fornire la posizione della risposta memorizzata. È una seconda fonte di copertura, non prova che non esistesse una pagina precedente.
Segui i reindirizzamenti all'indietro. Cerca il vecchio dominio, titolo, pagina autore e link in entrata. Le mappe di migrazione a volte rivelano l'URL predecessore più chiaramente di quanto faccia il sito corrente.
Tratta le date delle pagine come affermazioni da verificare
Una data "Pubblicato" visibile, una data nei dati strutturati, un'intestazione HTTP Last-Modified o una data all'interno di un URL possono aiutare, ma nessuna prova da sola la prima pubblicazione. Le migrazioni dei sistemi di gestione dei contenuti possono reimpostare i campi. Gli editori possono retrodatarli o correggerli. I server spesso generano Last-Modified dal comportamento di distribuzione o cache.
Preferisci l'accordo indipendente:
- la data di pubblicazione propria della pagina
- un'acquisizione d'archivio in quella data o poco dopo
- una voce di feed o sitemap datata
- un link contemporaneo da un altro sito
- un indice autore, numero o categoria contenente la pagina
Se tre record concordano e nulla di precedente li contraddice, puoi riportare una finestra di pubblicazione ben supportata. Mantieni le prove allegate alla conclusione.
Mantieni un registro delle prove
Una piccola tabella impedisce alle date di trasformarsi in ipotesi:
| Prova | Timestamp | Cosa prova | Limitazione |
|---|---|---|---|
| URL pagina archiviata | Tempo di acquisizione | Questa versione esisteva entro l'acquisizione | Potrebbe essere esistita prima |
| Voce feed datata | Data feed | Il sito elencava l'URL entro questa data | Le date dei feed possono essere migrate |
| Link in entrata indipendente | Data di pubblicazione | Un'altra pagina vi faceva riferimento entro questa data | Anche la data della pagina collegante necessita verifica |
| Metadati pagina corrente | Data visibile o automatica | Ciò che afferma il sito corrente | Può essere modificata o reimpostata |
Per ogni elemento, registra l'URL esatto, timestamp, titolo della pagina, testo rilevante e la data in cui vi hai avuto accesso. Se il risultato è importante legalmente o professionalmente, conserva screenshot o file secondo le regole probatorie che si applicano al tuo lavoro; non fare affidamento sul fatto che una scheda del browser rimanga disponibile.
Preserva la pagina corrente senza riscrivere la storia
Se la pagina live è importante e non ha acquisizione corrente, Save Page Now della Wayback Machine può crearne una. Internet Archive afferma che questo salva la singola pagina inserita e restituisce un URL permanente; non esegue la scansione dell'intero sito o dei suoi link in uscita.
Questa nuova acquisizione preserva la pagina da ora in avanti. Non riempie il vuoto nel passato e non deve mai essere presentata come prova di ciò che la pagina conteneva prima del tempo di acquisizione.
Formula la conclusione con precisione
Usa un linguaggio che esponga l'incertezza rimanente:
- Versione archiviata più antica trovata: l'acquisizione utilizzabile più vecchia localizzata per la famiglia di URL verificata.
- Affermazione presente entro: la prima acquisizione in cui appare il testo rilevante.
- Finestra di pubblicazione: dopo l'ultima acquisizione senza il contenuto e entro la prima acquisizione con esso.
- Prima esistenza verificata indipendentemente: un archivio, feed o link in entrata stabilisce che la pagina esisteva entro questa data.
- Non risolto: la copertura archivistica o la cronologia URL è insufficiente.
Non convertire mai "l'archivio non ha nulla di precedente" in "non esisteva nulla di precedente". Protezione tramite password, esclusioni crawler, pagine non collegate, contenuti renderizzati tramite script, fallimenti di scansione, rimozioni e semplice sfortuna creano tutti lacune.
Se la pagina contiene una foto o video la cui origine è in questione, continua con come trovare la fonte originale di una foto o video.