Vai al contenuto
AI.info

Ricerca

V-CoLA: compressione dei token visivi con attenzione lineare

I modelli visivo-linguistici (VLM) hanno dimostrato capacità notevoli, ma comportano un elevato costo computazionale, poiché i token visivi dominano la sequenza di input. La compressione dei token vis

V-CoLA: compressione dei token visivi con attenzione lineare
arXiv
2610.11251
Pubblicato
2026-10-08
Autori
Hao Jiang, Yiru Mao, Tianpeng Bu, Hao Zhou, Hongtao Duan, Wang Jing, Bowen Xu, Xin Chen, Lulu Hu, Bin Yang, Yongliang Tao, Minying Zhang

Abstract degli autori

I modelli visivo-linguistici (VLM) hanno dimostrato capacità notevoli, ma comportano un elevato costo computazionale, poiché i token visivi dominano la sequenza di input. La compressione dei token visivi è quindi una strada importante per ridurre questo carico. Tuttavia, con l’emergere di architetture ibride che incorporano l’attenzione lineare (\eg, Qwen3.5), i metodi precedenti, progettati per l’attenzione softmax, faticano a generalizzare. La nostra analisi mostra che sia gli approcci basati sull’attenzione sia quelli basati sulla similarità subiscono un calo significativo delle prestazioni, evidenziando l’urgente necessità di metodi di compressione adatti a questo contesto. A tale scopo proponiamo \textbf{V-CoLA}, un framework efficiente per la compressione dei token che non richiede addestramento ed è progettato specificamente per l’attenzione lineare. V-CoLA introduce un nuovo \textit{uniqueness-aware importance criterion} per individuare i token visivi cruciali, abbinato a una \textit{adaptive token merging strategy} che esegue la compressione. Tutti i componenti sono ottimizzati a livello implementativo per restare compatibili con il parallelismo per blocchi dell’attenzione lineare, garantendo una notevole utilità pratica. Esperimenti approfonditi su diversi benchmark dimostrano la superiorità di V-CoLA: raggiunge il 99,5\% delle prestazioni originali usando solo il 50,0\% dei token visivi e supera l’88,0\% usandone appena il 12,5\%, con un’accelerazione della fase di prefill compresa tra 1,86$\times$ e 6,15$\times$.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv