Ricerca
Il passato inquadra il futuro: la memoria per la generazione autoregressiva di video
I progressi nei modelli generativi hanno migliorato la fedeltà dei video, rendendo possibili generazioni su orizzonti temporali lunghi, la modellazione interattiva del mondo e ambienti visivi in evolu

- arXiv
- 2609.28466
- Pubblicato
- 2026-09-23
- Autori
- Harold Haodong Chen, Rongjin Guo, Disen Lan, Wen-Jie Shu, Hongfei Zhang, Hanzhe Hu, Shengtao Yao, Zixin Zhang, Guibin Zhang, Zhefan Rao, Jinxiu Liu, Yexin Liu, Rui Peng, Yuhao Liu, Bin Ren, Shuai Yang, Yukang Chen, Salman Khan, Ying-Cong Chen, Ser-Nam Lim, Rynson W. H. Lau, Nicu Sebe, Yu Cheng, Ming-Hsuan Yang, Qifeng Chen
Abstract degli autori
I progressi nei modelli generativi hanno migliorato la fedeltà dei video, rendendo possibili generazioni su orizzonti temporali lunghi, la modellazione interattiva del mondo e ambienti visivi in evoluzione. La generazione autoregressiva (AR) di video estende le sequenze visive attraverso generazioni causali successive. Emerge tuttavia un limite fondamentale: man mano che la sequenza generata si espande, i modelli pratici devono operare con finestre di contesto, capacità di archiviazione e risorse computazionali strettamente limitate. Di conseguenza, informazioni storiche cruciali — per esempio, identità delle entità, stati dinamici e cambiamenti causali indotti da interventi — spesso escono dal contesto attivo molto prima che venga meno la loro rilevanza. Superare questo limite e mantenere la persistenza temporale costituisce un problema fondamentale di memoria. Presentiamo una rassegna sistematica e completa dei meccanismi di memoria nella generazione autoregressiva di video. Definiamo operativamente la memoria come informazione storica persistente mantenuta attraverso passi AR esterni, in grado di influenzare le generazioni future anche quando le prove da cui ha origine non sono più accessibili localmente. Sulla base di questo quadro unificato, organizziamo la letteratura secondo cinque prospettive complementari: (I) forme, i supporti rappresentativi della storia; (II) funzioni, le informazioni semantiche e fisiche specifiche da preservare; (III) operazioni, il ciclo di vita della scrittura, lettura, aggiornamento, gestione e integrazione della memoria; (IV) apprendimento, l’ottimizzazione dei comportamenti della memoria durante generazioni successive a ciclo chiuso; e (V) valutazione, i paradigmi per diagnosticare autentiche capacità di memoria. Concludiamo sintetizzando le sfide aperte, tra cui architetture di memoria componibili e attente alle risorse, aggiornamento affidabile degli stati, apprendimento tramite generazioni autonome successive e valutazione standardizzata. Mettendo in relazione rappresentazioni, meccanismi e paradigmi di apprendimento, questo articolo stabilisce una base strutturata per lo sviluppo di sistemi affidabili di generazione video condizionati dalla memoria.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv