Ricerca
SteerDuplex: modelli di dialogo vocale duplex controllabili
I modelli di dialogo vocale full-duplex supportano il passaggio del turno a bassa latenza, la gestione delle interruzioni e i segnali di feedback, ma una capacità fondamentale è ancora poco esplorata:

- arXiv
- 2609.12623
- Pubblicato
- 2026-09-11
- Autori
- Utkarsh Tyagi, Ramaneswaran Selvakumar, Advait Gosai, Sonal Kumar, Nikhil Barhate, Isabell Sagar, Steven Li, Miheer Bavare, Daniel Quigley, Fabiola Tapia Carrillo, Jose M Patron E, Diego Macías Gutiérrez, Paul Song, Ramani Duraiswami, Dinesh Manocha, Yunzhong He
Abstract degli autori
I modelli di dialogo vocale full-duplex supportano il passaggio del turno a bassa latenza, la gestione delle interruzioni e i segnali di feedback, ma una capacità fondamentale è ancora poco esplorata: la controllabilità, cioè la capacità di modificare in modo affidabile il comportamento conversazionale in base ad attributi come tono, persona, velocità di eloquio e stile vocale, in risposta alle istruzioni dell’utente. Presentiamo una tassonomia della controllabilità basata su testo e audio, che individua lacune significative nei modelli full-duplex attuali. Per colmarle, presentiamo SteerDuplex, un modello vocale full-duplex basato su Moshi, sottoposto a fine-tuning su conversazioni naturali e dialoghi sintetici, con l’obiettivo di migliorare il rispetto delle istruzioni, la resa vocale, il ragionamento e l’interazione duplex. Applichiamo inoltre un apprendimento per rinforzo (RL) in due fasi con ricompense ibride, che combina verifiche interattive verificabili e feedback semantici basati su valutazioni, per migliorare la tempistica e la continuità delle risposte. Per valutare la controllabilità del parlato full-duplex, presentiamo SteerBench, un benchmark con 390 prompt vocali e 1.067 rubriche binarie, audio e testuali, redatte da persone e relative a tono, persona, stile/accento e velocità/lunghezza. Su SteerBench, l’addestramento supervisionato migliora di 44,5 punti percentuali il tasso medio di superamento per il controllo dell’audio rispetto al baseline open più forte tra quelli valutati. Su Audio MultiChallenge, il tasso medio di superamento dei compiti migliora di 7 punti rispetto al baseline open più forte tra quelli valutati. L’RL porta inoltre la risposta alle interruzioni in condizioni source-clean dal 72,5% all’82,5% e riduce le intrusioni durante le pause sintetiche dal 26,5% al 9%. I punteggi di controllabilità e quelli complessivi dei compiti restano comparabili o superiori, mentre le verifiche delle ricompense rivelano reward hacking attraverso risposte incomplete. Il nostro modello e il nostro benchmark favoriscono la ricerca sistematica sulla controllabilità del parlato; l’analisi delle ricompense mostra perché i miglioramenti nella tempistica vadano valutati insieme alla completezza delle risposte.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv