Vai al contenuto
AI.info

Ricerca

Sui fondamenti della progettazione dell’apprendimento di rappresentazioni testuali basate sui pixel

Gli input visivi ricchi di testo richiedono modelli capaci di leggere, recuperare e comprimere il linguaggio direttamente nello spazio dei pixel. Gli attuali codificatori di testo basati sui pixel, pe

Sui fondamenti della progettazione dell’apprendimento di rappresentazioni testuali basate sui pixel
arXiv
2609.01147
Pubblicato
2026-09-01
Autori
Chaohao Yuan, Ruifeng Yuan, Zhuoxu Huang, Yu Rong, Hong Cheng, Hou Pong Chan, Chenghao Xiao

Abstract degli autori

Gli input visivi ricchi di testo richiedono modelli capaci di leggere, recuperare e comprimere il linguaggio direttamente nello spazio dei pixel. Gli attuali codificatori di testo basati sui pixel, però, incontrano difficoltà legate al preaddestramento a risoluzione fissa, all’apprendimento di scorciatoie visive, a un debole ancoraggio visivo e alla comprensione del testo visivo multilingue. In questo lavoro esaminiamo i principi fondamentali di progettazione necessari per apprendere rappresentazioni robuste del testo visivo. Attraverso studi sistematici di ablazione controllata, individuiamo quattro componenti cruciali: risoluzioni variabili delle immagini e dimensioni variabili dei caratteri nel rendering forniscono indicatori spaziali utili alla generalizzazione ai documenti ad alta risoluzione; le coppie naturali immagine-testo sono indispensabili per l’ancoraggio visivo e impediscono il collasso verso il solo testo; un rendering che tiene conto del layout aiuta a evitare scorciatoie a livello di pixel; e un percorso di apprendimento multilingue in due fasi consente un efficace allineamento interlinguistico. Integrando questi principi in una procedura di addestramento scalabile, addestriamo Pixel Linguist II, un codificatore visivo a risoluzione nativa addestrato con rendering al momento dell’uso, ancoraggio contrastivo unificato e un percorso di apprendimento multilingue su 280 milioni di esempi di addestramento. Pixel Linguist II ottiene nuovi risultati allo stato dell’arte su Visual STS e ViDoRe in inglese, interlinguistici e multilingui, consentendo anche risultati migliori nelle valutazioni downstream degli MLLM. In particolare, Pixel Linguist II rimane robusto con una compressione dei token visivi dell’80\%, mostrando un notevole potenziale per la compressione ottica del contesto. Il nostro codice e le nostre risorse sono disponibili all’indirizzo https://github.com/Pixel-Linguist/Pixel-Linguist-II.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv