Ricerca
RECAP-Forcing: preservare le apparizioni dei contenuti nella generazione di video lunghi
La generazione autoregressiva di video lunghi pone un problema fondamentale di memoria: con una finestra di attenzione limitata, un modello deve decidere quali informazioni conservare da una sequenza

- arXiv
- 2608.26671
- Pubblicato
- 2026-08-27
- Autori
- Haiyang Xu, Zheng Ding, Zhuowen Tu
Abstract degli autori
La generazione autoregressiva di video lunghi pone un problema fondamentale di memoria: con una finestra di attenzione limitata, un modello deve decidere quali informazioni conservare da una sequenza di eventi sempre più lunga. I metodi esistenti organizzano la memoria secondo un criterio temporale: conservano i fotogrammi recenti e comprimono o scartano quelli più vecchi. Noi proponiamo invece RECAP-Forcing, che organizza la memoria in base alla novità dei contenuti visivi. Un video lungo non è soltanto una sequenza di fotogrammi, ma un insieme in evoluzione di soggetti, oggetti e scene le cui identità devono rimanere coerenti nel tempo. Organizziamo la memoria conservando la cache KV associata ai contenuti che compaiono per la prima volta — come i soggetti che entrano nell’inquadratura, le regioni non più occluse e le nuove scene — nel momento in cui diventano visibili, dando priorità alla novità rispetto alla vicinanza temporale. La memoria dovrebbe crescere in proporzione alla quantità di nuovi contenuti introdotti, anziché alla durata del video. Questa memoria indicizzata in base alle apparizioni rende la coerenza a lungo termine una proprietà esplicita della struttura della memoria. Il nostro approccio riunisce due meccanismi sotto questo unico principio. All’inizio di un video, quando tutti i contenuti visibili sono nuovi, un attention sink conserva la scena iniziale. Con l’evolversi del video, una banca delle novità basata sul flusso ottico applica lo stesso principio, conservando selettivamente i contenuti che vengono via via rivelati. Come metodo di inferenza che non richiede addestramento né parametri apprendibili aggiuntivi, RECAP-Forcing migliora costantemente la qualità visiva e la fedeltà semantica rispetto a diversi solidi metodi di riferimento e supera i metodi di gestione della memoria esistenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv