Ricerca
Dai pixel alla struttura: modelli visivo-linguistici leggeri per l’OCR dei documenti e l’estrazione di JSON strutturato
Sebbene i grandi modelli visivo-linguistici (VLM) a codice chiuso stabiliscano benchmark elevati per la comprensione dei documenti, la loro dipendenza da API commerciali ne limita l’adozione negli arc
- arXiv
- 2610.11818
- Pubblicato
- 2026-10-08
- Autori
- Uddipan Basu Bir, Vincent Christlein, Andreas Maier, Mathias Zinnen
Abstract degli autori
Sebbene i grandi modelli visivo-linguistici (VLM) a codice chiuso stabiliscano benchmark elevati per la comprensione dei documenti, la loro dipendenza da API commerciali ne limita l’adozione negli archivi istituzionali, per ragioni legate all’autonomia dei dati, ai costi ricorrenti e all’impronta ambientale del calcolo su scala hyperscale. Il problema è particolarmente acuto nella digitalizzazione del patrimonio culturale, dove i documenti comprendono testi manoscritti storici, terminologia specialistica (per esempio, gioielleria, preistoria, architettura) e impaginazioni non standard che richiedono un’estrazione strutturata ad alta dimensionalità. Presentiamo uno studio comparativo di otto VLM leggeri open source (fino a 7B parametri) per il passaggio dal riconoscimento ottico dei caratteri (OCR) alla struttura, condotto su tre collezioni universitarie di beni culturali. Data l’immagine di un documento, i modelli devono estrarre il testo e generare JSON conforme a uno schema, consentendo la validazione automatica e l’utilizzo successivo. Valutiamo i modelli con un protocollo che tiene conto dei vincoli, in modalità zero-shot e few-shot e dopo il fine-tuning, misurando la fedeltà dell’estrazione e la qualità dell’output strutturato mediante il tasso di errore sui caratteri (CER), la similarità di Levenshtein normalizzata approssimata (ANLS*) e la mean Average Precision F1 (mAP-F1). Rispetto a una baseline di fine-tuning, verifichiamo inoltre l’impatto indipendente di (i) ottimizzazione degli iperparametri, (ii) pre-elaborazione classica delle immagini (uniformazione dell’illuminazione, riduzione del rumore e CLAHE) e (iii) addestramento in più fasi. Infine, analizziamo il compromesso tra il fine-tuning specifico per ciascun dataset e un unico checkpoint multi-dataset: l’addestramento congiunto consente a un solo modello di operare su più collezioni, ma può modificare le prestazioni da un dataset all’altro. Nel complesso, mostriamo che VLM fino a 7B parametri, opportunamente adattati, possono offrire un’alternativa sostenibile, privata e dalle prestazioni elevate alla trascrizione manuale o ai sistemi commerciali a scatola nera, e forniamo indicazioni pratiche alle istituzioni che si occupano di patrimonio culturale e intendono effettuare l’estrazione da OCR a JSON sotto il proprio controllo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv