Vai al contenuto
AI.info

Ricerca

OmniSeek: integrazione nativa degli strumenti per il ragionamento audiovisivo in più turni

Presentiamo OmniSeek, un framework agentico che trasforma un Omni Large Language Model (Omni-LLM) in un agente capace di ragionare attivamente in più turni e di usare gli strumenti in modo nativo. Anz

OmniSeek: integrazione nativa degli strumenti per il ragionamento audiovisivo in più turni
arXiv
2610.02181
Pubblicato
2026-10-01
Autori
Haibo Wang, Jiteng Mu, Jialu Li, Jingru Yi, Yuanjun Xiong, Jianming Zhang, Lifu Huang, Mingze Xu

Abstract degli autori

Presentiamo OmniSeek, un framework agentico che trasforma un Omni Large Language Model (Omni-LLM) in un agente capace di ragionare attivamente in più turni e di usare gli strumenti in modo nativo. Anziché elaborare passivamente un’intera sequenza audiovisiva in un unico passaggio, OmniSeek integra la raccolta degli elementi di prova nel processo di ragionamento: decide dinamicamente se guardare o ascoltare, e su quale intervallo temporale concentrarsi, per recuperare elementi di prova sparsi ma cruciali da diverse modalità all’interno di contesti lunghi. Attraverso un protocollo iterativo in più turni, i segmenti audio o visivi grezzi recuperati vengono reinseriti nel contesto a sostegno del ragionamento successivo. Per sviluppare inizialmente questa capacità, realizziamo un sistema di generazione dei dati che produce OmniTraj-170K, un corpus di traiettorie Chain-of-Thought a più passaggi che intrecciano elementi di prova audio e visivi. Dapprima addestriamo il modello su queste traiettorie per insegnargli a usare gli strumenti in più turni, poi ottimizziamo ulteriormente la sua strategia tramite apprendimento per rinforzo in due fasi con ricompense verificabili. Introduciamo inoltre un obiettivo Audio-Visual Necessity che premia esplicitamente le traiettorie riuscite il cui ragionamento dipende da entrambe le modalità, scoraggiando le scorciatoie basate su una sola modalità. Numerosi esperimenti su un’ampia gamma di benchmark dimostrano che OmniSeek impara a cercare in modo adattivo elementi di prova tra diverse modalità e migliora sistematicamente le prestazioni nel ragionamento audiovisivo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv