Vai al contenuto
AI.info

Ricerca

Omni-Decision: pianificazione basata su un registro delle evidenze per agenti omni-modali

Per rispondere alle domande, gli agenti omni-modali devono cercare evidenze in video, audio, pagine web e calcoli. Il loro principale limite è la pianificazione: le osservazioni multimodali rumorose s

Omni-Decision: pianificazione basata su un registro delle evidenze per agenti omni-modali
arXiv
2607.11433
Pubblicato
2026-07-13
Autori
Ming Ma, Yi Zhu, Yiran Zhong, Feida Zhu, Yuhao Wang, Junhan Shi, Lingrui Mei, Tianming Yang, Steven Hoi

Abstract degli autori

Per rispondere alle domande, gli agenti omni-modali devono cercare evidenze in video, audio, pagine web e calcoli. Il loro principale limite è la pianificazione: le osservazioni multimodali rumorose si accumulano nella cronologia della conversazione e ostacolano le decisioni successive, mentre i modelli multimodali hanno una capacità limitata di pianificare su più passaggi. Sostituzioni controllate dei backend confermano questa diagnosi: sostituire il pianificatore provoca un calo delle prestazioni molto maggiore rispetto alla sostituzione del backend di percezione. Presentiamo Omni-Decision, un agente omni-modale basato sulla pianificazione tramite un registro delle evidenze: al posto della cronologia del dialogo, che continua a crescere, usa un registro esplicito che annota quali evidenze mancano ancora, quali sono state confermate e dove le registrazioni sono in conflitto. Un valutatore esamina ogni osservazione rumorosa e trasmette al registro solo il contenuto utilizzabile, scartando il resto. Il pianificatore lavora così su un contesto compatto per tutta la durata del compito. Ogni esecuzione registra lo stato, l’azione e il giudizio a ogni passaggio; il fine-tuning supervisionato e l’apprendimento per rinforzo a livello delle decisioni su queste traiettorie migliorano ulteriormente il pianificatore. Omni-Decision raggiunge un’accuratezza all’avanguardia dell’81,4% su OmniGAIA, con un costo per domanda pari a circa il 43% di quello di Gemini-3.1-Pro, e del 65,0% nella comprensione di video lunghi su WorldSense, alla pari con il modello end-to-end più performante.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv