Ricerca
MemLife: organizzare le memorie a lungo termine dei video egocentrici e ragionare su di esse
I video egocentrici di lungo periodo consentono agli assistenti di IA personalizzati di ragionare sulla vita quotidiana. Tuttavia, quando gli archivi video crescono fino a comprendere centinaia di ore

- arXiv
- 2609.40195
- Pubblicato
- 2026-09-30
- Autori
- Guangzhi Xiong, Xinyuan Zhang, Xiao Yang, Hyokun Yun, Kai Zhang, Shiun-Zu Kuo, Hyeonjeong Ha, Xilun Chen, Kai Sun, Lucas Liang, Guangqiang Dong, Ejaz Ahmed, Ahmed A Aly, Anuj Kumar, Raffay Hamid, Aidong Zhang, Xin Luna Dong
Abstract degli autori
I video egocentrici di lungo periodo consentono agli assistenti di IA personalizzati di ragionare sulla vita quotidiana. Tuttavia, quando gli archivi video crescono fino a comprendere centinaia di ore nell’arco di mesi o anni, rielaborare le clip originali per ogni richiesta diventa proibitivo dal punto di vista computazionale. I sistemi di memoria offrono un’alternativa scalabile condensando i video in rappresentazioni testuali, ma spesso non ottengono buoni risultati nei benchmark pratici: o la memoria non conserva le prove fondamentali, oppure il sistema di recupero non riesce a trovare le voci pertinenti a causa della competizione tra le voci in spazi di ricerca sempre più ampi. Per affrontare questi problemi, presentiamo MemLife, un sistema di memoria multimodale che costruisce episodi testuali in prima persona ancorati a entità e li recupera tramite un lettore agentico con indicizzazione temporale. Senza addestramento né accesso ai video al momento della richiesta, MemLife supera del 4,6–12,0% il più solido sistema di riferimento senza addestramento in quattro benchmark su orizzonti temporali lunghi. Per migliorare ulteriormente la qualità della memoria, proponiamo MemOpt, un framework di apprendimento per rinforzo che ottimizza il modulo di scrittura della memoria affinché produca memorie fedeli, informative e facili da recuperare. MemOpt migliora costantemente le prestazioni di MemLife del 2,7–5,0% con diverse distribuzioni di video e domande; i miglioramenti si generalizzano a diverse architetture di base dei moduli di scrittura e lettura e a diversi sistemi di memoria.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv