Ricerca
Solo MLP: ricostruzione efficiente degli stati visivi per i modelli linguistici multimodali
Le lunghe sequenze di token visivi rappresentano spesso una quota sostanziale del costo computazionale dei modelli linguistici multimodali di grandi dimensioni~(MLLMs). Gli approcci esistenti riducono

- arXiv
- 2609.34972
- Pubblicato
- 2026-09-28
- Autori
- Jingdi lei, Junxian Li, Di Zhang, Zhanqiu Zhang, Yiwen Guo, Soujanya Poria
Abstract degli autori
Le lunghe sequenze di token visivi rappresentano spesso una quota sostanziale del costo computazionale dei modelli linguistici multimodali di grandi dimensioni~(MLLMs). Gli approcci esistenti riducono questo costo eliminando i token visivi ridondanti, ma scartano definitivamente informazioni visive che potrebbero diventare utili nei livelli successivi. Ci chiediamo invece se sia possibile conservare tutti i token visivi riducendo il costo di far evolvere ripetutamente le loro rappresentazioni attraverso il Transformer. Per rispondere, interveniamo a basso rango sul flusso di informazioni dal visivo al testo. Scopriamo che, dopo aver bloccato l’attenzione dal visivo al testo, ripristinare anche solo poche direzioni consente di recuperare gran parte dell’accuratezza perduta: ciò suggerisce che l’influenza visiva rilevante sia concentrata in un sottospazio di bassa dimensionalità. Osserviamo inoltre che gli stati visivi specifici di ciascun livello sono altamente prevedibili: MLP leggere li approssimano con un’elevata similarità coseno e un basso errore di ricostruzione. Sulla base di questi risultati, proponiamo $δ$-Vision, che sostituisce la ripetuta evoluzione dei token visivi attraverso il Transformer con adattatori leggeri a basso rango. Questi costruiscono memorie visive per ciascun livello, mantenendo tutti i token visivi disponibili per il recupero da parte del testo. Nei benchmark su immagini e video, $δ$-Vision raggiunge un’accuratezza superiore a quella dei metodi di riferimento basati sull’eliminazione dei token visivi, a parità di costo computazionale o con un costo inferiore, e offre un’efficienza competitiva in inferenza senza scartare token visivi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv