Ricerca
Selezionare, comprimere, reinvestire: uno studio controllato sull’allocazione dei token visivi nei MLLM per video lunghi
I modelli linguistici per video lunghi non possono esaminare ogni fotogramma: un’ora di video campionata una volta al secondo produce 3.600 immagini, e un sistema ne conserva solo una piccola quota fi

- arXiv
- 2609.03820
- Pubblicato
- 2026-09-03
- Autori
- Prakhar Khatri
Abstract degli autori
I modelli linguistici per video lunghi non possono esaminare ogni fotogramma: un’ora di video campionata una volta al secondo produce 3.600 immagini, e un sistema ne conserva solo una piccola quota fissa. La scelta dei fotogrammi da conservare è di solito considerata un dettaglio di pre-elaborazione; verifichiamo se sia giusto trattarla così. I selettori pubblicati rendono difficile il confronto perché cambiano contemporaneamente il metodo di valutazione dei fotogrammi, i limiti del prompt, la politica sulla risoluzione e il modello che genera le risposte. Manteniamo fissi tutti questi elementi e variamo una decisione alla volta — selezione, compressione spaziale e reinvestimento delle risorse risparmiate — confrontando sei regole di selezione che non richiedono addestramento, tre benchmark per video lunghi e due modelli che generano le risposte. La selezione è la leva più incisiva: nella categoria dei video di un’ora di LongVideoBench, otto fotogrammi selezionati in base alla query superano di 6,9 punti sedici fotogrammi distribuiti a intervalli regolari. Orthogonal Matching Pursuit, un algoritmo di approssimazione sparsa risalente a decenni fa e usato senza modifiche, eguaglia o si colloca a non più di un punto da ciascuno dei selettori progettati ad hoc con cui lo confrontiamo, in tutti e tre i benchmark. La compressione ha un costo quasi nullo in termini di accuratezza: dimezzare il budget spaziale di ciascun fotogramma mantenendo fissi gli istanti selezionati comporta una perdita di al massimo 0,44 punti. È con il reinvestimento che le risorse risparmiate si traducono in accuratezza: usare i token liberati per elaborare il doppio dei fotogrammi compressi, a un costo misurato non superiore a quello degli otto fotogrammi originali, porta altri due o tre punti; la compressione conviene solo quando il risparmio viene impiegato in questo modo. Nel corso dello studio, un bug di implementazione nella nostra baseline AKS e un divario compreso tra 0,07 e 3,74 punti fra due infrastrutture di valutazione che applicano le stesse regole pubblicate con lo stesso budget mostrano perché questi confronti vadano condotti all’interno di un’unica infrastruttura di valutazione controllata, anziché tra studi diversi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv