Vai al contenuto
AI.info

Ricerca

Duplex-MPE: valutare l’interazione tra più partecipanti nel dialogo full-duplex

I modelli vocali full-duplex in tempo reale possono ascoltare mentre parlano, rendendo possibile un’interazione naturale senza rigidi confini tra i turni di parola. I benchmark esistenti valutano l’al

Duplex-MPE: valutare l’interazione tra più partecipanti nel dialogo full-duplex
arXiv
2609.31948
Pubblicato
2026-09-25
Autori
Chengqian Ma, Wenhao Feng, Weixuan Jin, Gaole Dai, Tianyu Xie, Yuexiao Ma, Zhaolu Kang, Xiangyu Zhao, Xiawu Zheng, Fei Chao

Abstract degli autori

I modelli vocali full-duplex in tempo reale possono ascoltare mentre parlano, rendendo possibile un’interazione naturale senza rigidi confini tra i turni di parola. I benchmark esistenti valutano l’alternanza dei turni, la gestione delle interruzioni e il dialogo su più turni, ma si concentrano perlopiù su un utente designato, anziché su un assistente che partecipa a una conversazione tra più persone. Presentiamo Duplex-MPE per valutare quando un assistente di questo tipo debba rispondere, restare in silenzio o smettere di parlare. Il benchmark comprende 2.000 scenari con tre o quattro interlocutori umani e un assistente; per ciascuno, la stessa richiesta viene rivolta in modo esplicito o implicito. I modelli ricevono l’audio continuo della conversazione, senza trascrizioni né confini tra i turni forniti in anticipo. Quattro punteggi misurano l’avvio di una nuova risposta, l’accuratezza delle risposte, il mantenimento del silenzio e la capacità di smettere di parlare quando una persona risolve una richiesta. Valutiamo cinque sistemi vocali a pesi aperti: MiniCPM-o 4.5, Moshi, FLM-Audio, Voila e Freeze-Omni. MiniCPM-o 4.5 è primo in tre delle capacità valutate, mentre negli altri sistemi una frequente produzione vocale può coesistere con risposte inaccurate o con l’incapacità di restare in silenzio. Un sistema di riferimento basato sulle trascrizioni, Gemini 3.1 Pro, risponde alle richieste esplicite con una frequenza superiore di 64,3 punti percentuali rispetto a quelle implicite; i test su coppie di casi non rilevano differenze significative nel tasso di risposta dei sistemi vocali.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv