Ricerca
Sui fondamenti della progettazione dell’apprendimento di rappresentazioni testuali basate sui pixel
Gli input visivi ricchi di testo richiedono modelli capaci di leggere, recuperare e comprimere il linguaggio direttamente nello spazio dei pixel. Gli attuali codificatori di testo basati sui pixel, pe

- arXiv
- 2609.01147
- Pubblicato
- 2026-09-01
- Autori
- Chaohao Yuan, Ruifeng Yuan, Zhuoxu Huang, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao
Abstract degli autori
Gli input visivi ricchi di testo richiedono modelli capaci di leggere, recuperare e comprimere il linguaggio direttamente nello spazio dei pixel. Gli attuali codificatori di testo basati sui pixel, però, incontrano difficoltà legate al preaddestramento a risoluzione fissa, all’apprendimento di scorciatoie visive, a un debole ancoraggio visivo e alla comprensione del testo visivo multilingue. In questo lavoro esaminiamo i principi fondamentali di progettazione necessari per apprendere rappresentazioni robuste del testo visivo. Attraverso studi sistematici di ablazione controllata, individuiamo quattro componenti cruciali: risoluzioni variabili delle immagini e dimensioni variabili dei caratteri nel rendering forniscono indicatori spaziali utili alla generalizzazione ai documenti ad alta risoluzione; le coppie naturali immagine-testo sono indispensabili per l’ancoraggio visivo e impediscono il collasso verso il solo testo; un rendering che tiene conto del layout aiuta a evitare scorciatoie a livello di pixel; e un percorso di apprendimento multilingue in due fasi consente un efficace allineamento interlinguistico. Integrando questi principi in una procedura di addestramento scalabile, addestriamo Pixel Linguist II, un codificatore visivo a risoluzione nativa addestrato con rendering al momento dell’uso, ancoraggio contrastivo unificato e un percorso di apprendimento multilingue su 280 milioni di esempi di addestramento. Pixel Linguist II ottiene nuovi risultati allo stato dell’arte su Visual STS e ViDoRe in inglese, interlinguistici e multilingui, consentendo anche risultati migliori nelle valutazioni downstream degli MLLM. In particolare, Pixel Linguist II rimane robusto con una compressione dei token visivi dell’80\%, mostrando un notevole potenziale per la compressione ottica del contesto. Il nostro codice e le nostre risorse sono disponibili all’indirizzo https://github.com/Pixel-Linguist/Pixel-Linguist-II.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv