Vai al contenuto
AI.info

Ricerca

Studiare i tokenizer di immagini come linguaggi visivi nei modelli multimodali unificati

I tokenizer di immagini definiscono il «linguaggio visivo» dei modelli multimodali unificati, ma vengono comunemente studiati attraverso metriche isolate o valutazioni limitate alla sola generazione o

Studiare i tokenizer di immagini come linguaggi visivi nei modelli multimodali unificati
arXiv
2609.09143
Pubblicato
2026-09-08
Autori
Siting Li, Zhengyang Wang, Simon Shaolei Du, Xi Chen, Yang Liu

Abstract degli autori

I tokenizer di immagini definiscono il «linguaggio visivo» dei modelli multimodali unificati, ma vengono comunemente studiati attraverso metriche isolate o valutazioni limitate alla sola generazione o alla sola comprensione. Queste valutazioni non colgono appieno come si comportano i token visivi quando vengono modellati insieme al testo. Costruiamo un ambiente di test controllato, puramente autoregressivo, e monitoriamo le perdite di validazione specifiche per compito durante il preaddestramento multimodale continuo, per la predizione di testo, immagini, testo a partire da immagini (I2T) e immagini a partire da testo (T2I). Esaminiamo come queste perdite variano al crescere della scala e come si rapportano alle prestazioni nei compiti successivi; le usiamo poi per studiare quanto bene i token di immagini e testo vengano modellati congiuntamente e per analizzare la progettazione dei tokenizer. Rileviamo che (1) le perdite vanno analizzate per compito, poiché seguono andamenti distinti al crescere della scala e producono classifiche diverse dei tokenizer. (2) Il rapporto tra perdita e prestazioni dipende dallo spazio dei token da predire: per un tokenizer fissato, le perdite T2I e I2T sono correlate alla qualità della generazione, ma, confrontando tokenizer diversi, il rapporto tra perdita T2I e prestazioni cambia al variare dello spazio dei token di immagini, mentre la perdita I2T, calcolata su un vocabolario testuale condiviso, fornisce un segnale più coerente. La perdita I2T è inoltre correlata sia alle prestazioni nella generazione sia a quelle nella comprensione visiva dopo il fine-tuning supervisionato. Usando le perdite come chiave di lettura, mostriamo che (3) una ricostruzione migliore non comporta necessariamente perdite specifiche per compito più basse né prestazioni migliori nei compiti successivi, e che (4) la scelta del tokenizer di immagini può influire sulla modellazione del testo nell’ottimizzazione congiunta. Come casi di studio, riesaminiamo tre aspetti della progettazione dei tokenizer — il discriminatore, la supervisione semantica e la dimensione del vocabolario — per valutarne gli effetti sulla modellazione congiunta e sulle prestazioni nei compiti successivi. Nel complesso, il nostro ambiente di test offre una prospettiva complementare sui tokenizer di immagini come linguaggi visivi, mettendo in luce la loro interazione con il testo nell’addestramento multimodale congiunto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv