The Pulse
Google lancia Gemini 3.8 Flash TTS per creare voci personalizzate
Google sta rilasciando Gemini 3.8 Flash TTS e Flash-Lite TTS, con strumenti per progettare voci personalizzate, controllare l’interpretazione battuta per battuta, mettere in scena dialoghi e applicare watermark integrati.

AI.info Team ·
Google porta la progettazione delle voci dentro Gemini
Google sta rilasciando due modelli di sintesi vocale che permettono agli utenti di progettare voci, dirigere l’interpretazione battuta per battuta e generare scene dialogate a partire da un unico copione. Gemini 3.8 Flash TTS punta su un controllo creativo dettagliato, mentre Gemini 3.8 Flash-Lite TTS è destinato a impieghi su scala più ampia, come il doppiaggio, la produzione audio e gli agenti vocali.
Il rilascio dei modelli inizia il 23 settembre 2026 tramite la Gemini API e Google AI Studio. Gemini 3.8 Flash TTS arriverà anche su Gemini Enterprise ed è disponibile in Gemini Notebook, mentre il rilascio della versione Flash-Lite su Google Vids è in corso per gli utenti in generale.
Google descrive i due modelli come i più espressivi finora tra quelli dell’azienda per la generazione audio. Secondo l’azienda, supportano più di 100 lingue e dialetti, con controlli per accenti, ritmo, emozioni, caratteristiche vocali e tempi della conversazione.
«Oggi presentiamo due nuovi modelli di sintesi vocale della famiglia Gemini, che trasformano la generazione delle voci da una scelta di impostazioni predefinite statiche a uno studio creativo dinamico».
— Leland Rechis, responsabile di gruppo per i prodotti, e Alan Cowen, direttore della ricerca scientifica, a nome del Gemini Audio Team di Google
Dalle voci predefinite ai personaggi generati
Gemini 3.8 Flash TTS può creare una voce a partire da una descrizione in linguaggio naturale, senza richiedere agli sviluppatori di sceglierla da un catalogo fisso. Gli utenti possono specificare il ruolo di un personaggio, il suo accento e le sue qualità vocali, quindi salvare il profilo risultante per utilizzarlo nell’intero progetto.
Google afferma che il modello dà accesso a più di 2.000 voci pronte per la produzione e supporta varietà regionali, tra cui lo spagnolo messicano, il francese del Québec e l’inglese scozzese. L’azienda propone inoltre il sistema per la creazione di personaggi originali in giochi, audiolibri immersivi, podcast e media interattivi.
È supportata la replica di una voce a partire da un campione audio di 30 secondi, a condizione che l’utente abbia il permesso di usare la voce originale. Google afferma che il processo comprende la verifica del consenso, il watermark SynthID e le credenziali C2PA. La replica delle voci tramite AI Studio non è disponibile in Illinois, Texas, nello Spazio economico europeo, nel Regno Unito, in Svizzera o in India.
Indicazioni battuta per battuta e scene a due voci
Entrambi i modelli accettano istruzioni per l’interpretazione insieme al copione. Chi crea il contenuto può richiedere un tono calmo, una battuta sussurrata, un cambiamento d’intensità emotiva o una pronuncia regionale per singoli passaggi, invece di applicare uno stesso stile all’intera registrazione.
I modelli supportano anche segnali non verbali e brevi risposte che accompagnano la conversazione. Tra gli esempi citati da Google ci sono risate, sospiri, sussulti e brevi segnali di ascolto attivo, come «mhm» e «sì». Gemini 3.8 Flash TTS può mettere in scena conversazioni tra due persone a partire da un unico copione, mantenendo distinte le voci e gestendo l’alternanza dei turni di parola.
Un altro obiettivo è la generazione di contenuti audio lunghi. Secondo Google, i modelli mantengono la qualità della voce, il ritmo e il timbro dei personaggi per ore di audio, con variazioni limitate nella resa delle voci: una capacità pensata per audiolibri, podcast e altre registrazioni di lunga durata.
Google cita i risultati di Hume e Voice Arena
Google afferma che Gemini 3.8 Flash TTS è al primo posto nel Voice Design Benchmark di Hume AI con un punteggio di 71,4 e guida la valutazione della modellazione degli accenti con un punteggio di 60,8. L’azienda sostiene inoltre che Flash TTS e Flash-Lite TTS occupano rispettivamente il primo e il secondo posto nell’Overall Quality Index di Hume AI.
Google riferisce che i modelli occupano le prime posizioni nelle valutazioni alla cieca delle preferenze umane condotte da Voice Arena per giapponese, portoghese brasiliano, vietnamita, arabo standard moderno, spagnolo messicano e hindi. Si tratta di risultati di benchmark riportati dall’azienda, non di una valutazione indipendente inclusa nell’annuncio.
Un watermark integrato in ogni clip generata
Google afferma che ogni clip audio prodotta dai suoi modelli Gemini Audio contiene un watermark SynthID impercettibile. Il watermark è progettato per aiutare a identificare il parlato generato dall’IA, mentre le credenziali C2PA vengono usate per la replica delle voci per fornire ulteriori informazioni sull’origine del contenuto.
Gli sviluppatori possono iniziare a testare i modelli in Google AI Studio e tramite la Gemini API. Google annovera Agora, LiveKit, Pipecat e Vercel tra le piattaforme che utilizzano l’API e indica Figma, HeyGen, Linguana, Wondercraft, 99.co e Ollang tra le aziende che stanno integrando i nuovi sistemi TTS.