Vai al contenuto
AI.info

Ricerca

Fin dove possono arrivare i dati sintetici nell’OCR del thailandese?

Esaminiamo quali fattori permettono alla supervisione OCR sintetica di trasferirsi ai documenti thailandesi reali e usiamo quanto appreso per sviluppare Wayu-Paxa-OCR-Zero, un modello OCR per il thail

Fin dove possono arrivare i dati sintetici nell’OCR del thailandese?
arXiv
2609.03595
Pubblicato
2026-09-03
Autori
Kunat Pipatanakul

Abstract degli autori

Esaminiamo quali fattori permettono alla supervisione OCR sintetica di trasferirsi ai documenti thailandesi reali e usiamo quanto appreso per sviluppare Wayu-Paxa-OCR-Zero, un modello OCR per il thailandese adattato senza etichette OCR provenienti da pagine di documenti thailandesi reali. I dati sintetici forniscono etichette esatte su larga scala, ma il «realismo» confonde tra loro il dominio di origine, il contesto della pagina, la tipografia, la struttura spaziale e la variazione dei glifi. Separiamo questi fattori con una pipeline controllata di ricostruzione dei documenti e valutiamo ciascuna variante con un addestramento a livello di pagina e di ritaglio su documenti thailandesi stampati e manoscritti. Il contesto non testuale ha un effetto poco costante, mentre la varietà dei caratteri tipografici, la struttura bidimensionale e i glifi tratti da testi manoscritti reali migliorano il trasferimento. Inoltre, l’importanza della corrispondenza con il dominio di origine dipende dalla granularità dell’addestramento: a livello di pagina, la ricostruzione nello stesso dominio si avvicina alla supervisione basata su documenti stampati reali (tasso mediano di errore sui caratteri dell’1,82% contro l’1,31%), ma a livello di ritaglio ottiene risultati inferiori alla ricostruzione fuori dominio (15,59% contro 5,52%). Sulla base di questi risultati, adattiamo PaddleOCR-VL-1.6, da 0,9 miliardi di parametri, per ottenere Wayu-Paxa-OCR-Zero usando 45.723 pagine sintetiche: rispetto al checkpoint di partenza, il modello riduce il tasso mediano di errore sui caratteri dal 6,64% all’1,24% sulle pagine stampate e dal 74,87% al 20,55% sui testi manoscritti. Supera inoltre Typhoon OCR v1 7B in tutti e cinque i set di valutazione, mostrando che un addestramento basato soltanto su dati sintetici può essere competitivo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv