Vai al contenuto
AI.info

Ricerca

VideoLoop: memoria di lavoro ciclica contro il thrashing semantico negli agenti per video di lunga durata

Comprendere video di lunga durata richiede agli agenti multimodali di raccogliere evidenze in modo iterativo, attraverso numerosi passaggi di ragionamento. Tuttavia, la maggior parte dei metodi basati

VideoLoop: memoria di lavoro ciclica contro il thrashing semantico negli agenti per video di lunga durata
arXiv
2609.38119
Pubblicato
2026-09-29
Autori
Jinfa Huang, Jianming Xu, Jingyang Lin, Zhengyuan Yang, Jiebo Luo

Abstract degli autori

Comprendere video di lunga durata richiede agli agenti multimodali di raccogliere evidenze in modo iterativo, attraverso numerosi passaggi di ragionamento. Tuttavia, la maggior parte dei metodi basati su agenti soffre di thrashing semantico: man mano che la memoria di lavoro a sola aggiunta cresce, l’attenzione alle evidenze fondamentali crolla e l’agente perde l’accesso a ciò che ha già trovato. In primo luogo, presentiamo un’argomentazione strutturale secondo cui una memoria a sola aggiunta può incorporare nuove evidenze osservate relative all’obiettivo, ma non può eliminare il rumore accumulato né impedire la crescita ordinata del contesto senza un operatore di riscrittura. In secondo luogo, sulla base di questa analisi, proponiamo VideoLoop, un agente multimodale con due cicli collegati. Il ciclo esterno ragiona sul video; quello interno, dopo ogni passaggio, recupera elementi da un filesystem senza limiti che conserva osservazioni passate e analisi intermedie, e riscrive una memoria di lavoro di dimensioni limitate. Numerosi esperimenti dimostrano l’efficacia di VideoLoop, che migliora quattro diffusi backbone LVLM senza richiedere modifiche, con un guadagno medio di 4,2 punti percentuali rispetto alla baseline su VideoMME (long). Un’ulteriore analisi della memoria di lavoro suggerisce che VideoLoop attenua il thrashing semantico: per il quarto di domande più difficili di VideoMME (long), un valutatore cieco che legge soltanto il contesto dell’agente risponde correttamente all’81,1%, contro il 60,9% nel caso dell’agente a sola aggiunta. Con Gemini 3.1 Pro, VideoLoop raggiunge l’88,3% su VideoMME (long), l’88,8% su VideoMMMU e l’80,9% su LongVideoBench (long).

Leggi il paper originale su arXiv