Vai al contenuto
AI.info

Ricerca

CoEvoWhen: coevoluzione di politiche e strumenti per la localizzazione temporale nei video ultralunghi

La localizzazione temporale nei video ultralunghi richiede di bilanciare la ricerca di evidenze su lunghi intervalli con la comprensione dettagliata degli eventi, disponendo di un budget visivo limita

CoEvoWhen: coevoluzione di politiche e strumenti per la localizzazione temporale nei video ultralunghi
arXiv
2609.40048
Pubblicato
2026-09-30
Autori
Yiduo Jia, Muzhi Zhu, Jinchuan Shi, Hao Zhong, Yuling Xi, Ke Liu, Hao Chen

Abstract degli autori

La localizzazione temporale nei video ultralunghi richiede di bilanciare la ricerca di evidenze su lunghi intervalli con la comprensione dettagliata degli eventi, disponendo di un budget visivo limitato. I metodi agentici esistenti, tuttavia, si basano ancora in larga misura su politiche e capacità degli strumenti predefinite. Per questo proponiamo un nuovo framework di coevoluzione di politiche e strumenti che fa evolvere congiuntamente politiche di alto livello e strumenti multimediali eseguibili a partire dalle traiettorie di ragionamento agentico di un VLM, dando vita a una competenza riutilizzabile senza aggiornare i parametri del modello. Durante l’evoluzione, un componente esterno che aggiorna la competenza distilla l’esperienza trasferibile maturata nella localizzazione temporale nei video lunghi e affina di conseguenza il coordinamento tra osservazioni basate su immagini, estese su lunghi intervalli, e osservazioni dettagliate basate su video. Parallelamente agli aggiornamenti delle politiche, il componente sfrutta le proprie capacità di programmazione per migliorare gli strumenti esistenti o crearne di nuovi, adattandoli alla raccolta di evidenze nei video lunghi. Grazie alla competenza così evoluta, il VLM coordina autonomamente gli strumenti seguendo la politica evoluta e combina osservazioni basate su immagini e video per l’inferenza agentica, senza ricorrere a un modello di pianificazione separato e più potente. Numerosi esperimenti condotti su cinque benchmark e tre VLM mostrano che la coevoluzione di politiche e strumenti migliora sistematicamente l’accuratezza della localizzazione temporale nei video ultralunghi, riducendo al contempo il costo in token visivi durante l’inferenza. Mostrano inoltre che la competenza evoluta produce miglioramenti sostanziali nelle prestazioni della QA generale su video lunghi, senza un’ulteriore evoluzione specifica per il compito, a dimostrazione dell’efficacia e della generalizzabilità del nostro framework per la comprensione dei video lunghi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv