Ricerca
Institutional Newspapers Pipeline: ricavare miliardi di token di alta qualità dai giornali storici
I giornali storici sono una ricca testimonianza della vita pubblica, ma la loro impaginazione densa, irregolare e talvolta disturbata da artefatti rende l’accesso a questi materiali con strumenti info

- arXiv
- 2608.18972
- Pubblicato
- 2026-08-19
- Autori
- Matteo Cargnelutti, Catherine Brobston, Eben English, Jake Sadow, Kacie Bailey, Greg Leppert, Amanda Watson, Jessica Chapel, Jonathan Zittrain
Abstract degli autori
I giornali storici sono una ricca testimonianza della vita pubblica, ma la loro impaginazione densa, irregolare e talvolta disturbata da artefatti rende l’accesso a questi materiali con strumenti informatici difficile e limitato. Presentiamo Institutional Newspapers Pipeline, un sistema modulare che abbiamo progettato insieme alla Boston Public Library per ricavare dataset strutturati di alta qualità dalle scansioni di giornali storici. Il sistema è stato progettato in modo che ogni fase resti interpretabile e personalizzabile e che l’intera pipeline richieda risorse di calcolo abbastanza contenute da poter funzionare su hardware da workstation. Ogni scansione passa attraverso più fasi: viene suddivisa in singoli ritagli indipendenti dalla tipologia, sui quali viene eseguito il riconoscimento ottico dei caratteri (OCR). Su ciascun ritaglio vengono poi effettuati l’analisi del testo, la classificazione per tipologia e per argomento, il rilevamento dell’ordine di lettura e della lingua, il riconoscimento delle entità nominate e la generazione di embedding precalcolati. Abbiamo applicato la pipeline a una parte delle collezioni della Boston Public Library e pubblicato i risultati come dataset aperto. Il testo prodotto dall’OCR comprende 16,3 miliardi di token o200k_base, distribuiti su 83,1 milioni di singoli ritagli ricavati da 1.473.635 scansioni di giornali di pubblico dominio pubblicati tra il 1795 e il 1930. Questo rapporto descrive i metodi impiegati in ogni fase di elaborazione, i modelli di piccole dimensioni che abbiamo addestrato, i risultati della valutazione e le misurazioni effettuate sull’intero dataset. Accompagna la pubblicazione della pipeline, dei modelli e del dataset. Consideriamo questo lavoro un passo importante verso la possibilità di ricavare dati di alta qualità da decine di milioni di scansioni di giornali.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv