Vai al contenuto
AI.info

Ricerca

Sviluppare e valutare un sistema TTS thailandese a voce fissa a partire da parlato sintetico

In contesti con risorse limitate, realizzare un sistema TTS richiede in genere di scegliere tra un grande modello di clonazione vocale, costoso da usare in inferenza, e un sistema compatto a voce fiss

Sviluppare e valutare un sistema TTS thailandese a voce fissa a partire da parlato sintetico
arXiv
2609.03502
Pubblicato
2026-09-03
Autori
Kunat Pipatanakul, Potsawee Manakul, Warit Sirichotedumrong, Sittipong Sripaisarnmongkol, Pakorn Nathong, Phatrasek Jirabovonvisut

Abstract degli autori

In contesti con risorse limitate, realizzare un sistema TTS richiede in genere di scegliere tra un grande modello di clonazione vocale, costoso da usare in inferenza, e un sistema compatto a voce fissa che richiede un corpus specifico di un parlante. Studiamo una terza via: usare un grande modello di clonazione vocale come fonte di dati programmabile per trasformare un breve campione vocale di riferimento, per esempio di 15 secondi, in un modello studente compatto a voce fissa, addestrato interamente su parlato sintetico. In questo scenario, la progettazione della pipeline ha conseguenze importanti: gli errori del modello insegnante diventano obiettivi di addestramento, mentre filtrare le generazioni non riuscite può ridurre la copertura dei testi difficili. Il thailandese presenta ulteriori sfide legate all’ambiguità dei confini tra le parole, al tono lessicale, ai nomi e ai prestiti linguistici, alla verbalizzazione dei numeri e all’alternanza tra thailandese e inglese. Studiamo come la preparazione dei testi, la generazione sintetica, il filtraggio per qualità, il campionamento per rifiuto e le scelte relative al frontend influiscano sul modello studente risultante, e dove permangano i limiti del modello insegnante. Valutiamo CER, Challenge-Set Keyword Accuracy, Prosody Pause Accuracy, somiglianza della voce e velocità del parlato. Il modello risultante, Wayu-Paxa-TTS-Edge, ha 82 milioni di parametri e consente di eseguire TTS in thailandese direttamente sul dispositivo, senza audio di riferimento. Raggiunge il 68,2% nella Challenge-Set Keyword Accuracy, pari all’85,5% del risultato di Gemini 3.1, e una precisione delle pause del 91,4%, superiore a quella del modello insegnante OmniVoice (89,9%) e pari al 94,8% del risultato di Gemini 3.1. Registra inoltre i tassi più bassi di errori nel posizionamento delle pause e di pause all’interno delle parole tra i tre sistemi, e un CER del 3,7% per il thailandese e dell’1,1% per l’inglese. Rendiamo open source il modello e il framework di valutazione per lo sviluppo di sistemi TTS in thailandese.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv