Ricerca
Riconoscimento multilingue unificato del testo nelle scene con Mixture-of-Experts che tiene conto del sistema di scrittura
Il riconoscimento multilingue del testo nelle scene (STR) resta difficile a causa della scarsità di dati di addestramento per la maggior parte delle lingue e della difficoltà di gestire diversi sistem

- arXiv
- 2609.24058
- Pubblicato
- 2026-09-21
- Autori
- Xingsong Ye, Yongkun Du, Jiaxin Zhang, Zhixian Li, Chong Sun, Chen Li, Jing Lyu, Lianwen Jin, Zhineng Chen
Abstract degli autori
Il riconoscimento multilingue del testo nelle scene (STR) resta difficile a causa della scarsità di dati di addestramento per la maggior parte delle lingue e della difficoltà di gestire diversi sistemi di scrittura con un unico modello. Le soluzioni esistenti impiegano un riconoscitore per ogni lingua, aumentando i costi e causando un accumulo di errori, oppure si affidano a grandi modelli visione-linguaggio (VLM), costosi e ancora imprecisi per molti sistemi di scrittura. In questo lavoro puntiamo a un riconoscitore multilingue unificato, più semplice degli esperti specifici per lingua, più leggero dei VLM e più accurato di entrambi. Per prima cosa, realizziamo TextMuSS-10M, un dataset sintetico su larga scala di testo nelle scene che copre 10 sistemi di scrittura e 229 lingue. Fornisce dati di supervisione bilanciati e sufficienti laddove non sono disponibili dati reali. Proponiamo poi ScriptMoE, un’architettura Mixture-of-Experts (MoE) che tiene conto del sistema di scrittura. Condivide un unico encoder visivo e sostituisce il decoder denso con un blocco MoE sparso, composto da un router a livello di immagine che instrada ogni immagine verso i 2 esperti con i punteggi più alti tra quelli allineati al sistema di scrittura, e da un esperto condiviso che assorbe conoscenze trasversali ai sistemi di scrittura. Ampi esperimenti su TextMuSS-Bench, il benchmark che abbiamo assemblato (10 sistemi di scrittura, 10.899 immagini), mostrano che ScriptMoE raggiunge l’accuratezza più alta, pari all’82,06%, superando dell’1,31% il più forte modello di riferimento per STR. Nel compito multilingue end-to-end CC-OCR, sostituire il solo riconoscitore di PP-OCRv5 con ScriptMoE porta il punteggio F1 dal 65,71% all’80,89%, superando di poco il miglior VLM (80,73%) con una frazione del numero di parametri.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv