Ricerca
EM^2Mem: memoria multimodale incentrata sugli eventi per i grandi modelli linguistici
La memoria multimodale offre un’interfaccia scalabile per rispondere a domande su video lunghi, ma i metodi esistenti spesso recuperano didascalie, fotogrammi, trascrizioni, riassunti o fatti rapprese

- arXiv
- 2609.00551
- Pubblicato
- 2026-09-01
- Autori
- Yijun Chen, Yaqi Zheng, Yanya Li, Boyi Xiao, Buqiang Xu, Shuofei Qiao, Jizhan Fang, Xinle Deng, Yunzhi Yao, Xuehai Wang, Liuxin Zhang, Hui Li, Huajun Chen, Shumin Deng
Abstract degli autori
La memoria multimodale offre un’interfaccia scalabile per rispondere a domande su video lunghi, ma i metodi esistenti spesso recuperano didascalie, fotogrammi, trascrizioni, riassunti o fatti rappresentati in grafi come frammenti isolati. Pur essendo ricercabili, questi frammenti non sono pronti per la generazione: i modelli linguistici devono ricostruire gli allineamenti tra modalità e nel tempo durante l’inferenza, quando il contesto è limitato e l’attribuzione è difficile. Proponiamo EM^2Mem, un’architettura di memoria multimodale incentrata sugli eventi che, durante la costruzione della memoria, associa evidenze eterogenee ad ancore degli eventi. Ogni cella di memoria indicizzata per evento allinea record multimodali, contesto temporale, relazioni collegate tramite grafi, fatti semantici e provenienza, consentendo una lettura compatta delle evidenze basata su eventi multimodali ancorati ai dati, anziché su frammenti specifici delle singole modalità. Su tre benchmark di domande e risposte relative a video lunghi, EM^2Mem supera la migliore baseline basata sulla memoria nell’accuratezza media di 2,0, 2,4 e 3,7 punti, migliora di 7,0 punti il recall Top-5 delle evidenze secondo un criterio rigoroso a livello di evento e riduce la latenza per query di un fattore 4,67 e il numero totale di token usati per l’inferenza del 63,66% (il codice sarà integrato in https://github.com/zjunlp/LightMem).
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv