Vai al contenuto
AI.info

Ricerca

Quanto manca all’eliminazione dell’encoder visivo? Leggi di scala per il preaddestramento multimodale senza encoder

La maggior parte dei moderni modelli linguistici multimodali di grandi dimensioni (MLLM) si basa su un encoder visivo preaddestrato che fornisce un solido prior visivo. Gli MLLM senza encoder apprendo

Quanto manca all’eliminazione dell’encoder visivo? Leggi di scala per il preaddestramento multimodale senza encoder
arXiv
2609.35457
Pubblicato
2026-09-28
Autori
Lin Chen, Bolin Ni, Qi Yang, Lan Jiang, Kun Ding, Xiaoran Fan, Hower Yang, Ying Wang, Shiming Xiang

Abstract degli autori

La maggior parte dei moderni modelli linguistici multimodali di grandi dimensioni (MLLM) si basa su un encoder visivo preaddestrato che fornisce un solido prior visivo. Gli MLLM senza encoder apprendono invece le rappresentazioni visive direttamente dai pixel grezzi, offrendo un’architettura semplice e unificata, ma il loro comportamento al crescere della scala non è stato studiato sistematicamente. Per colmare questa lacuna, confrontiamo le leggi di scala degli MLLM con e senza encoder e riportiamo tre risultati principali: (1) Eliminare l’encoder visivo sposta la distribuzione ottimale delle risorse computazionali per l’obiettivo multimodale verso modelli più grandi, mentre lascia pressoché invariata quella per il testo. (2) Le due architetture presentano frontiere tra perdita e costo computazionale quasi sovrapposte per l’obiettivo testuale, ma divergono per quello multimodale: i modelli senza encoder ottengono risultati inferiori su piccola scala, ma si prevede che raggiungano gli altri intorno a $10^{22}$ FLOPs, ampiamente entro budget di preaddestramento praticabili. (3) Senza un encoder visivo, il modello linguistico impara ad assumerne il ruolo attraverso un adattamento specifico per la visione: le interazioni bidirezionali tra token visivi diventano sempre più vantaggiose al crescere delle risorse computazionali impiegate nell’addestramento, l’elaborazione visiva si sposta verso i livelli iniziali e l’instradamento dei token visivi verso gli esperti diventa più concentrato. Nel complesso, i nostri risultati indicano che il vantaggio del prior visivo fornito da un encoder preaddestrato diminuisce con la scala, rendendo le architetture senza encoder una direzione promettente per il preaddestramento multimodale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv