Ricerca
Ripensare l’efficienza nell’analisi dei video lunghi: una prospettiva di allocazione congiunta di fotogrammi, pixel e latenza della fase iniziale
L’analisi efficiente dei video lunghi con modelli visione-linguaggio (VLM) viene spesso impostata come una selezione di fotogrammi informativi o token visivi a una risoluzione nativa fissa. Mostriamo

- arXiv
- 2610.04318
- Pubblicato
- 2026-10-03
- Autori
- Sixun Dong, Wei Li, Andong Deng, Qi Qian, Victor Zhu, Zhengping Ji, Chen Chen
Abstract degli autori
L’analisi efficiente dei video lunghi con modelli visione-linguaggio (VLM) viene spesso impostata come una selezione di fotogrammi informativi o token visivi a una risoluzione nativa fissa. Mostriamo invece che si può ridurre la risoluzione dei singoli fotogrammi per ottenere una copertura temporale più fitta, mentre la latenza della decodifica nella fase iniziale dipende dalle dimensioni dell’insieme dei candidati, non dal budget finale di token. Uno studio empirico su diversi VLM e benchmark per video lunghi porta a tre risultati: a parità di budget di token, un campionamento fitto a bassa risoluzione supera un campionamento rado a risoluzione nativa; le attività sensibili alla risoluzione traggono beneficio da fotogrammi selezionati ad alta risoluzione; e, per i video di un’ora, la decodifica nella fase iniziale assorbe la maggior parte del tempo effettivo di esecuzione. Sulla base di questi risultati, presentiamo LoHi, un sistema che non richiede addestramento né passaggi multipli e combina un flusso video fitto a bassa risoluzione con fotogrammi immagine radi ad alta risoluzione, utilizzando i percorsi nativi del VLM per video e immagini. LoHi-Anchor seleziona i fotogrammi ad alta risoluzione usando i metadati dei fotogrammi I del codec, mentre LoHi-SemDiv usa la pertinenza rispetto alla richiesta e la diversità visiva delle caratteristiche CLIP. Su tre benchmark per video lunghi, LoHi aumenta l’accuratezza media di 10,6 punti percentuali rispetto alla configurazione di riferimento a risoluzione nativa, a parità di budget di token, e di 5,2 punti percentuali rispetto al più efficace metodo precedente per migliorare l’efficienza. Riduce inoltre la latenza della decodifica nella fase iniziale fino a 7 volte per i video di un’ora. Pagina del progetto: https://sixundong.com/projects/lohi
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv