Vai al contenuto
AI.info

Ricerca

HiPLEX: fattorizzazione gerarchica della policy per modelli linguistici del parlato full-duplex

Con il diffondersi di interazioni più conversazionali tra esseri umani e IA, diventano sempre più importanti i modelli linguistici del parlato full-duplex capaci di sostenere dialoghi naturali in temp

HiPLEX: fattorizzazione gerarchica della policy per modelli linguistici del parlato full-duplex
arXiv
2610.07727
Pubblicato
2026-10-06
Autori
Kyudan Jung, Hyunsin Park, Yoonhyung Lee, Jinhwan Park, Jinhyeok Yang, KiHyun Nam, Jaegul Choo, Jinkyu Lee

Abstract degli autori

Con il diffondersi di interazioni più conversazionali tra esseri umani e IA, diventano sempre più importanti i modelli linguistici del parlato full-duplex capaci di sostenere dialoghi naturali in tempo reale. Oltre a generare risposte appropriate, questi modelli devono coordinare in tempo reale l’alternanza dei turni, i segnali di ascolto e la gestione della parola. L’apprendimento per rinforzo (RL) permette di affinare questi comportamenti attraverso un feedback diretto sugli esiti delle interazioni. I metodi di RL esistenti, però, applicano il feedback sui tempi a una policy sui token oppure ottimizzano il contenuto semantico, lasciando irrisolto il miglioramento congiunto di tempi e contenuto. Presentiamo HiPLEX, un framework di RL che scompone una policy testuale full-duplex preaddestrata in una policy di controllo, che decide quando emettere contenuto, e una policy condizionale per il contenuto, che decide che cosa emettere. Il primo fattore sceglie tra «pad», «epad» e «con». Il secondo sceglie un token solo quando viene selezionato «con». Questa struttura gerarchica descrive azioni condizionali all’interno di ciascun frame e usa il componente testuale già presente nel modello. Indirizziamo i valori di vantaggio relativi ai tempi al fattore che seleziona il gruppo di token tramite maschere causali basate sugli eventi, ricavate dagli episodi di parlato generati, e indirizziamo al fattore condizionale per il contenuto un valore di vantaggio semantico assegnato da un LLM giudice. Su tre seed di Moshi in Full-Duplex-Bench v1, HiPLEX riduce rispetto a GRPO i tassi di presa della parola durante le pause naturali dell’utente e le occasioni per emettere segnali di ascolto, e abbrevia la latenza delle risposte dopo un’interruzione, mantenendo una qualità comparabile delle risposte alle interruzioni secondo la valutazione del giudice. Su Moshi e PersonaPlex, HiPLEX riproduce le distribuzioni marginali aggregate osservate negli esseri umani per i tempi di alternanza dei turni e i tassi dei segnali di ascolto meglio di GRPO.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv