Ricerca
OmniReasoning: spingere i limiti del ragionamento congiunto audiovisivo
I recenti progressi hanno permesso di sviluppare modelli omnimodali unificati capaci di comprendere audio, contenuti visivi e linguaggio. Tuttavia, i benchmark, i dati di addestramento e i metodi di a

- arXiv
- 2609.39490
- Pubblicato
- 2026-09-30
- Autori
- Junming Lin, Yuxuan Wang, Zhenxin Lei, Yuxin Liu, Ruixun Liu, Yinsong Yan, Ling Wang, Minghao Han, Yunfei Chu, Shun Lei, Xueyao Zhang, Qize Yang, Jin Xu, Yiwu Zhong
Abstract degli autori
I recenti progressi hanno permesso di sviluppare modelli omnimodali unificati capaci di comprendere audio, contenuti visivi e linguaggio. Tuttavia, i benchmark, i dati di addestramento e i metodi di apprendimento esistenti trattano in gran parte le modalità separatamente: la capacità di ragionamento congiunto audiovisivo resta quindi scarsamente valutata e non adeguatamente sollecitata. Per colmare questa lacuna, proponiamo un benchmark, un motore per la generazione di dati e un metodo di apprendimento. Innanzitutto, presentiamo OmniReasoningBench, un benchmark in cui sono indispensabili sia gli elementi audio sia quelli visivi. Comprende 1.150 domande a scelta multipla e a risposta aperta, suddivise tra due compiti: il ragionamento sui video e il ragionamento oltre i video. Sviluppiamo poi OmniQA, un motore che costruisce automaticamente coppie domanda-risposta fondate su evidenze e che richiedono esplicitamente il ragionamento congiunto audiovisivo, insieme a catene di indizi con marcature temporali che guidano l’annotazione del processo di ragionamento. Oltre al nostro benchmark, il motore produce i dati di addestramento OmniReasoning-SFT-112K e OmniReasoning-RL-19K. Infine, proponiamo Modality-Factored Self-Distillation (MFSD), un metodo di autodistillazione on-policy. Il metodo valuta ogni risposta campionata in contesti di indizi specifici per modalità, distinguendo il contributo dei singoli indizi da quello delle loro interazioni tra modalità per attribuire il merito a livello di token. Grazie ai nostri dati di addestramento e al nostro metodo di apprendimento, il nostro modello OmniReasoning-30B-A3B ottiene il 50,0% su OmniVideoBench e il 42,5% su OmniReasoningBench, migliorando i risultati del modello di base Qwen3-Omni-30B-A3B-Thinking rispettivamente di 12,8 e 9,3 punti percentuali. Ottiene inoltre miglioramenti sostanziali nei benchmark generali e in quelli dedicati ai video lunghi, tra cui Video-MME-v2. Ci auguriamo che il nostro lavoro costituisca un solido passo avanti per favorire la ricerca futura sul ragionamento congiunto omnimodale.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv