Ricerca
Oltre la selezione: parametrizzazione dei token per una compressione estrema dei token visivi
La compressione dei token visivi migliora l’efficienza dei modelli visivo-linguistici, ma con budget di compressione estremi l’eliminazione dei token può compromettere l’ancoraggio visivo, mentre i ri

- arXiv
- 2609.35232
- Pubblicato
- 2026-09-28
- Autori
- Rui Zhong, Yu Li, Zheyu Yan, Cheng Zhuo
Abstract degli autori
La compressione dei token visivi migliora l’efficienza dei modelli visivo-linguistici, ma con budget di compressione estremi l’eliminazione dei token può compromettere l’ancoraggio visivo, mentre i ricampionatori appresi aumentano il numero di parametri, il costo dell’attenzione e la complessità dell’addestramento. Riesaminiamo la compressione dal punto di vista della parametrizzazione dei token, distinguendo tra (i) trasformazione della base e troncamento strutturato (sottospazio mantenuto/comprimibilità) e (ii) organizzazione delle coordinate (ottimizzazione e allineamento tra modalità). Da questa prospettiva emergono due obiettivi collegati, comprimibilità e apprendibilità, che formalizziamo come funzionali unificati. Guidati da questi obiettivi, progettiamo Braco, un codificatore leggero in quattro passaggi che combina il troncamento della base di trasformazione, embedding delle coordinate della base indipendenti dall’input, una riparametrizzazione ortogonale dipendente dal budget e token residui spaziali appresi tramite un pooling leggero. Gli esperimenti mostrano che Braco si colloca sulla frontiera empirica più favorevole nel rapporto tra accuratezza ed efficienza con una compressione di $23\times$--$64\times$ e resta competitivo a $144\times$: raggiunge un’accuratezza del 95,2% riducendo i FLOP della fase di prefill dell’84,2%--86,7% rispetto al limite superiore senza compressione. Rispetto ai metodi precedenti, Braco eguaglia o migliora l’accuratezza, ottenendo al contempo un’accelerazione end-to-end fino a circa il 36% e una latenza e un numero di FLOP del compressore inferiori, rispettivamente, di $16.6\times$/$78.8\times$.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv