Ricerca
OmniVChat: sintesi, benchmarking e addestramento per il dialogo audiovisivo nativo
Definiamo OmniVChat (Omni Video Chat) come il compito di dialogo audiovisivo nativo tra un utente e un modello omni. In OmniVChat, i modelli omni ricevono direttamente e simultaneamente audio e video

- arXiv
- 2609.21465
- Pubblicato
- 2026-09-18
- Autori
- Haolin He, Yunfei Chu, Qi Chen, Wen Huang, Yuan Feng, Muzhi Zhu, Zheqi Dai, Haoning Xu, Dongchao Yang, Chunyat Wu, Zining Liang, Zhengxi Liu, Xiquan Li, Xie Chen, Xize Cheng, Qize Yang, Jin Xu, Qiuqiang Kong
Abstract degli autori
Definiamo OmniVChat (Omni Video Chat) come il compito di dialogo audiovisivo nativo tra un utente e un modello omni. In OmniVChat, i modelli omni ricevono direttamente e simultaneamente audio e video da un utente e restituiscono testo. La richiesta dell’utente è incorporata nell’audio e nel video, senza una domanda testuale separata, didascalie esterne o riconoscimento vocale. L’input audiovisivo diretto riduce la latenza e il calcolo esterni, preservando al contempo gli indizi percettivi. Tuttavia, la ricerca su OmniVChat deve fare i conti con due vincoli: la disponibilità dei dati e la valutazione. Le registrazioni di persone che usano i propri dispositivi sono scarse. Inoltre, una buona risposta spesso deve tenere conto dell’ambiente circostante l’utente, delle sue espressioni facciali e degli oggetti vicini; risposte di questo tipo possono essere formulate in molti modi diversi, rendendo inaffidabile la corrispondenza di parole chiave per valutare la qualità delle risposte. I recenti progressi nei sistemi agentici e nella generazione video rendono praticabile la generazione per la comprensione, ovvero l’uso di dialoghi sintetizzati per l’addestramento e la valutazione. Presentiamo quindi OmniVChat-Studio, un motore di dati multiagente per sintetizzare dialoghi audiovisivi a turno singolo e a più turni. Usiamo i dialoghi sintetizzati per realizzare OmniVChat-Bench, un benchmark di valutazione delle capacità di base dei modelli omni nel dialogo, articolate in cinque categorie. Presentiamo inoltre OmniVChat-RL, una progettazione della ricompensa per l’apprendimento per rinforzo che punta congiuntamente alla correttezza, all’efficienza e allo stile delle risposte in OmniVChat. L’addestramento di Qwen3-Omni-Instruct con OmniVChat-RL su dialoghi sintetizzati ne migliora le prestazioni sia su OmniVChat-Bench sia su OmniVChat-Bench-Human, basato su registrazioni umane. Questi miglioramenti convalidano la progettazione della ricompensa e mostrano il trasferimento ai dialoghi del mondo reale nell’addestramento e nella valutazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv