Vai al contenuto
AI.info

Ricerca

EM^2Mem: memoria multimodale incentrata sugli eventi per i grandi modelli linguistici

La memoria multimodale offre un’interfaccia scalabile per rispondere a domande su video lunghi, ma i metodi esistenti spesso recuperano didascalie, fotogrammi, trascrizioni, riassunti o fatti rapprese

EM^2Mem: memoria multimodale incentrata sugli eventi per i grandi modelli linguistici
arXiv
2609.00551
Pubblicato
2026-09-01
Autori
Yijun Chen, Yaqi Zheng, Yanya Li, Boyi Xiao, Buqiang Xu, Shuofei Qiao, Jizhan Fang, Xinle Deng, Yunzhi Yao, Xuehai Wang, Liuxin Zhang, Hui Li, Huajun Chen, Shumin Deng

Abstract degli autori

La memoria multimodale offre un’interfaccia scalabile per rispondere a domande su video lunghi, ma i metodi esistenti spesso recuperano didascalie, fotogrammi, trascrizioni, riassunti o fatti rappresentati in grafi come frammenti isolati. Pur essendo ricercabili, questi frammenti non sono pronti per la generazione: i modelli linguistici devono ricostruire gli allineamenti tra modalità e nel tempo durante l’inferenza, quando il contesto è limitato e l’attribuzione è difficile. Proponiamo EM^2Mem, un’architettura di memoria multimodale incentrata sugli eventi che, durante la costruzione della memoria, associa evidenze eterogenee ad ancore degli eventi. Ogni cella di memoria indicizzata per evento allinea record multimodali, contesto temporale, relazioni collegate tramite grafi, fatti semantici e provenienza, consentendo una lettura compatta delle evidenze basata su eventi multimodali ancorati ai dati, anziché su frammenti specifici delle singole modalità. Su tre benchmark di domande e risposte relative a video lunghi, EM^2Mem supera la migliore baseline basata sulla memoria nell’accuratezza media di 2,0, 2,4 e 3,7 punti, migliora di 7,0 punti il recall Top-5 delle evidenze secondo un criterio rigoroso a livello di evento e riduce la latenza per query di un fattore 4,67 e il numero totale di token usati per l’inferenza del 63,66% (il codice sarà integrato in https://github.com/zjunlp/LightMem).

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv