The Pulse
Google offre agli agenti vocali in tempo reale due velocità diverse
La documentazione della Live API di Google distingue Gemini 3.8 Live da Gemini 3.8 Live Extended Thinking e illustra approcci diversi a latenza, ragionamento, chiamate agli strumenti e stato della sessione.

AI.info Team ·
Google offre agli agenti vocali in tempo reale due velocità diverse
La documentazione di Google AI for Developers descrive due modelli vocali in tempo reale: gemini-3.8-live e gemini-3.8-live-extended-thinking. La documentazione distingue gli scambi vocali diretti e a bassa latenza dalle interazioni che richiedono pianificazione, ragionamento in più fasi o chiamate agli strumenti che possono richiedere più tempo.
Entrambi i modelli si usano con la Gemini Live API, che Google descrive come uno strumento per conversazioni vocali bidirezionali in tempo reale. Le pagine dei modelli indicano testo, immagini, audio e video come input supportati, con testo e audio in output.
«Il modello pianifica e chiama strumenti asincroni in background mentre parla usando intercalari naturali per mantenere attiva l’interazione.» — Google AI for Developers, editore della documentazione
Il modello standard gemini-3.8-live è pensato per agenti vocali in cui è importante rispondere subito a ogni turno e le attività sono dirette. Tra gli usi suggeriti da Google figurano la gestione preliminare delle richieste di assistenza clienti, l’esercizio delle lingue, la ricerca vocale e la narrazione interattiva. Google indica inoltre come attività adatte le azioni esterne rapide, come leggere i valori dei sensori o controllare dispositivi intelligenti.
Con il modello standard, ogni turno dell’utente produce un’unica risposta del modello. Un segnale turnComplete: true indica che il modello ha finito di parlare e che la sessione è inattiva. Google afferma che il modello adotta un approccio di ragionamento intercalato con un profilo di latenza fisso; non supporta un thinking_level configurabile.
Extended Thinking cambia il ciclo di vita della sessione
gemini-3.8-live-extended-thinking è pensato per agenti vocali che devono esaminare informazioni complesse, pianificare più passaggi o attendere strumenti esterni. Tra gli usi documentati figurano gli agenti di supporto che esaminano registri, codici di errore e verifiche della configurazione; gli agenti di viaggio e prenotazione che cercano voli e hotel; e i sistemi di tutoraggio che verificano formule o correggono errori nel codice prima di rispondere.
Invece di lasciare chi chiama ad attendere in silenzio mentre è in funzione uno strumento, il modello Extended Thinking può fornire aggiornamenti intermedi a voce. Per descrivere questo comportamento, la documentazione di Google usa l’esempio «Controllo ora le opzioni di volo». Il modello può continuare a elaborare in background, effettuare chiamate asincrone agli strumenti e fornire una risposta vocale finale una volta completata l’attività più ampia.
In una sessione Extended Thinking, il segnale turnComplete: true ha quindi un significato più circoscritto. Può indicare la fine di una singola enunciazione, compreso un aggiornamento vocale intermedio, senza segnalare che tutto il ragionamento e il lavoro degli strumenti sono terminati. I client devono monitorare anche interaction_status.
Lo stato IN_PROGRESS indica che il server sta ancora elaborando la richiesta dell’utente, svolgendo ragionamenti in background o attendendo la risposta di uno strumento asincrono. Lo stato IDLE indica che l’elaborazione, il ragionamento e le chiamate agli strumenti sono terminati e che la sessione è pronta a ricevere altri input dall’utente. Le applicazioni che mostrano uno stato di ascolto o decidono quando accettare un’altra richiesta devono quindi basarsi sullo stato dell’interazione, anziché fare affidamento soltanto sul segnale di completamento del turno.
Requisiti diversi per la configurazione e gli strumenti
Google consente agli sviluppatori di configurare la profondità del ragionamento del modello Extended Thinking con i valori low, medium o high per thinking_level. L’impostazione MINIMAL non è supportata. Le dichiarazioni di funzioni per questo modello devono usare il comportamento non bloccante, NON_BLOCKING; Google afferma che le funzioni sincrone bloccanti restituiscono un errore.
Questo richiede ai client di gestire più messaggi nell’ambito di quella che per l’utente è un’unica richiesta. Una sessione può ricevere una risposta audio intermedia, una chiamata a uno strumento, la risposta dello strumento e una risposta finale. La documentazione afferma che i client dovrebbero continuare ad ascoltare dopo un segnale turnComplete: true se interaction_status è ancora IN_PROGRESS.
Le indicazioni di Google per la migrazione indicano gemini-3.1-flash-live-preview come un precedente modello della Live API. Per trasferire un’applicazione esistente a gemini-3.8-live occorre modificare la stringa del modello e omettere thinking_level o thinking_config dalla configurazione del modello standard. Le applicazioni che adottano Extended Thinking devono aggiungere la gestione dello stato, configurare strumenti non bloccanti e tenere conto degli output vocali intermedi.
La distinzione lascia agli sviluppatori una scelta su quale modello usare: Gemini 3.8 Live per turni di conversazione rapidi e comandi diretti, oppure Gemini 3.8 Live Extended Thinking quando un’interazione vocale richiede un ragionamento più approfondito e attività esterne di più lunga durata.