Ricerca
Il ragionamento omni-streaming
I modelli omnimodali in streaming devono decidere cosa rispondere e quando, sulla base dei segmenti video e dell’audio sincronizzato osservati fino a quel momento. Gli indizi visivi spesso avvalorano

- arXiv
- 2609.15128
- Pubblicato
- 2026-09-14
- Autori
- Enjun Du, Siyi Liu, Ziyu Zheng, Jingyu Li, Yiwen Guo, Yongqi Zhang, Difan Zou
Abstract degli autori
I modelli omnimodali in streaming devono decidere cosa rispondere e quando, sulla base dei segmenti video e dell’audio sincronizzato osservati fino a quel momento. Gli indizi visivi spesso avvalorano un’interpretazione prima che un enunciato o un evento sonoro sia completo. Se questa interpretazione viene memorizzata come un fatto, il ragionamento successivo può continuare a riproporla anche dopo che l’audio l’ha contraddetta. Chiamiamo questo errore assunzione intermodale prematura. Proponiamo Omni-Streaming Thinking (OST), che genera output strutturati comprendenti le evidenze osservate fino a quel momento, previsioni sulle evidenze future e affermazioni basate su tali evidenze. Ogni affermazione è inizialmente contrassegnata come in attesa di verifica e collegata a un intervallo di verifica futuro. Le evidenze audio e visive sono conservate separatamente e, alla fine dell’intervallo di verifica, OST confronta l’affermazione con le evidenze della modalità specificata. Quando rileva evidenze contraddittorie, un processo di confutazione riduce l’influenza dell’affermazione e degli stati che ne dipendono, quindi guida un aggiornamento dello stato sulla base delle nuove evidenze. Un meccanismo di controllo decide se le affermazioni determinanti per la risposta soddisfano le condizioni per rispondere. Utilizzando un backbone Qwen3-Omni-30B-A3B-Instruct congelato con un adattamento leggero, OST supera le più forti baseline aperte su cinque benchmark di streaming e audiovisivi, con un vantaggio medio di oltre il 10% in termini relativi. Presentiamo inoltre OST-DiagBench, che mantiene fisso il video e modifica l’audio per verificare accordo, assenza, contraddizione, coesistenza e conflitto tra sottotitoli e parlato. OST raggiunge un d-prime = 2,95, contro un massimo di 1,38 per le baseline aperte, riducendo al contempo le allucinazioni uditive indotte dalle immagini.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv