Vai al contenuto
AI.info

Ricerca

KeyRec: memoria visiva limitata per la comprensione di flussi e video lunghi

I modelli visivo-linguistici sono sempre più utilizzati per comprendere video lunghi e flussi continui. Tuttavia, i token visivi ad alta densità si accumulano con la durata del video, rendendo proibit

KeyRec: memoria visiva limitata per la comprensione di flussi e video lunghi
arXiv
2609.32182
Pubblicato
2026-09-26
Autori
Zihan Chen, Xuejian Rong, Xiaojuan Wang, Boqing Gong, Adi Zicher, Yael Pritch, Nikhil Karnad

Abstract degli autori

I modelli visivo-linguistici sono sempre più utilizzati per comprendere video lunghi e flussi continui. Tuttavia, i token visivi ad alta densità si accumulano con la durata del video, rendendo proibitivamente costosa l’inferenza su contesti lunghi. I metodi esistenti per selezionare i token visivi senza addestramento riducono questo costo conservando i token informativi, ma possono perdere prove coerenti degli eventi e non distinguere le osservazioni recenti dettagliate dalla storia più lontana. Proponiamo \textbf{KeyRec}, un framework che costruisce una memoria visiva limitata senza addestramento. Nella fase di scrittura, indipendente dalla domanda, KeyRec conserva le osservazioni recenti dettagliate in una cache visiva e organizza le prove storiche in un archivio strutturato degli eventi. Gli eventi candidati vengono proposti in base alla loro novità rispetto agli eventi già memorizzati e gestiti mediante aggiornamenti online che li aggiungono, li accorpano o li eliminano. Quando arriva una domanda, un sistema di instradamento basato solo sul testo ripartisce in modo adattivo un budget fisso di lettura tra la memoria recente e quella degli eventi, senza elaborare nuovamente i fotogrammi passati. KeyRec opera sugli embedding visivi destinati al modello e supporta sia i VLM modulari con encoder e proiettore, sia l’architettura NEO-ov, priva di entrambi. Su quattro benchmark per flussi e video lunghi e tre modelli VLM di base, KeyRec ottiene le migliori prestazioni con compressione in 13 configurazioni su 15, usando solo il 10\% del budget di token visivi ad alta densità destinati al decoder. Supera il più forte metodo di riferimento con compressione di 2,21–18,37 punti nelle domande in tempo reale, ottiene il miglior risultato con compressione in cinque delle sei configurazioni con video lunghi e registra le migliori prestazioni in ogni configurazione NEO-ov 2B.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv