Ricerca
EmoRES-TTS: steering vettoriale potenziato dalla componente residua per la generazione di parlato emotivo
I modelli di sintesi vocale (TTS) condizionati dall’emozione potrebbero non esprimere in modo affidabile l’emozione richiesta, mentre migliorarne la controllabilità con ulteriore addestramento è costo

- arXiv
- 2609.38157
- Pubblicato
- 2026-09-29
- Autori
- Kuan-Po Huang, Haohe Liu, Puyuan Peng, Haibin Wu, Zhaoheng Ni, Hung-yi Lee, Jinwon Lee, Neha Chachra
Abstract degli autori
I modelli di sintesi vocale (TTS) condizionati dall’emozione potrebbero non esprimere in modo affidabile l’emozione richiesta, mentre migliorarne la controllabilità con ulteriore addestramento è costoso sia in termini di calcolo sia di dati di addestramento costituiti da parlato etichettato per emozione. Studiamo quindi lo steering vettoriale, un approccio che non richiede addestramento e modifica le rappresentazioni interne di un modello i cui parametri restano invariati. CoCoEmo, un metodo convenzionale di steering vettoriale per la sintesi vocale emotiva, tratta ogni vettore dell’emozione come un’unica direzione indivisibile, regolata da un solo parametro globale di intensità: questo limita l’aderenza all’emozione richiesta. In questo lavoro scopriamo innanzitutto che un vettore dell’emozione può essere scomposto in una componente condivisa, che allontana il parlato da un’espressione neutra, e in una componente residua, che orienta la generazione verso l’emozione richiesta. Sulla base di questa scoperta proponiamo Emotion Residual-Enhanced Steering for TTS (EmoRES), un nuovo metodo che regola le due componenti senza riaddestrare il modello di base. Su IEMOCAP, EmoRES supera CoCoEmo in tutte e quattro le metriche oggettive dell’emozione con i modelli di base IndexTTS-2 e CosyVoice2. La correlazione per ranghi aumenta rispettivamente di 26,13 e 12,97 punti percentuali, pari a miglioramenti relativi del 118,8% e del 33,1%, mentre il tasso di successo per l’emozione aumenta rispettivamente di 12,95 e 6,92 punti, pari a miglioramenti relativi del 20,1% e del 9,8%. Una valutazione condotta su persone mostra inoltre un miglioramento relativo fino al 35,0% nel tasso con cui gli ascoltatori identificano correttamente l’emozione dominante richiesta e un miglioramento fino al 17,3% nella fedeltà. Nei confronti a coppie, gli ascoltatori preferiscono EmoRES per naturalezza fino al 63,8% delle volte. Le analisi di ablazione delle componenti dimostrano inoltre che, per ottenere un controllo efficace, è utile preservare la componente condivisa rafforzando al contempo quella residua dei vettori di steering dell’emozione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv