Ricerca
Oltre il recupero: evoluzione progressiva della memoria latente per la comprensione dei video in streaming
La comprensione dei video in streaming richiede che i modelli linguistici multimodali di grandi dimensioni (MLLM) elaborino input visivi continui e rispondano alle richieste degli utenti rispettando r

- arXiv
- 2609.04131
- Pubblicato
- 2026-09-03
- Autori
- Hongyu Qu, Guangming Yao, Ling Xing, Xiaobin Hu, Rongxing Ding, Guibin Zhang, Fan Zhang, Yi Yuan, Xiangbo Shu, Shuicheng Yan
Abstract degli autori
La comprensione dei video in streaming richiede che i modelli linguistici multimodali di grandi dimensioni (MLLM) elaborino input visivi continui e rispondano alle richieste degli utenti rispettando rigidi vincoli di causalità e di memoria. Gli approcci esistenti in genere comprimono le osservazioni passate in una memoria esterna, dalla quale recuperano elementi pertinenti alla richiesta da usare come contesto visivo aggiuntivo. Pur essendo efficace, questo paradigma di archiviazione e recupero mantiene gli elementi del passato come contesto visivo esterno, impedendo che vengano integrati in una memoria latente compatta e in evoluzione, capace di guidare continuamente il ragionamento in streaming. Per colmare questa lacuna, presentiamo LatentStream, un sistema di memoria di lavoro latente progressiva che sposta la memoria per lo streaming dall’archiviazione e recupero al recupero e all’interiorizzazione. LatentStream comprende tre componenti coordinati. In primo luogo, Query-agnostic Hierarchical Streaming Memory organizza la storia visiva su tre livelli, a breve, medio e lungo termine, entro un budget di memoria fisso, attraverso un consolidamento adattivo guidato da Jenks. Quando arriva una richiesta, Hierarchical Latent Memory Evolution dota gruppi di token di memoria latente di campi recettivi della memoria progressivamente più ampi, consentendo loro di recuperare in modo iterativo elementi del passato dai rispettivi ambiti e di integrarli in una memoria latente compatta e di lunghezza fissa. Infine, Progressive Confidence-guided Latent Memory Optimization costruisce una ricompensa gerarchica per la progressione a partire dall’entropia predittiva di ciascun gruppo e perfeziona congiuntamente i token di memoria latente e gli elementi recuperati, favorendo un ragionamento in streaming sempre più sicuro. Numerosi esperimenti dimostrano che LatentStream ottiene nuovi risultati allo stato dell’arte sui benchmark video online e offline esistenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv