Vai al contenuto
AI.info

The Pulse

Google offre agli agenti vocali in tempo reale due velocità diverse

La documentazione della Live API di Google distingue Gemini 3.8 Live da Gemini 3.8 Live Extended Thinking e illustra approcci diversi a latenza, ragionamento, chiamate agli strumenti e stato della sessione.

Google offre agli agenti vocali in tempo reale due velocità diverse

AI.info Team ·

Google offre agli agenti vocali in tempo reale due velocità diverse

La documentazione di Google AI for Developers descrive due modelli vocali in tempo reale: gemini-3.8-live e gemini-3.8-live-extended-thinking. La documentazione distingue gli scambi vocali diretti e a bassa latenza dalle interazioni che richiedono pianificazione, ragionamento in più fasi o chiamate agli strumenti che possono richiedere più tempo.

Entrambi i modelli si usano con la Gemini Live API, che Google descrive come uno strumento per conversazioni vocali bidirezionali in tempo reale. Le pagine dei modelli indicano testo, immagini, audio e video come input supportati, con testo e audio in output.

«Il modello pianifica e chiama strumenti asincroni in background mentre parla usando intercalari naturali per mantenere attiva l’interazione.» — Google AI for Developers, editore della documentazione

Il modello standard gemini-3.8-live è pensato per agenti vocali in cui è importante rispondere subito a ogni turno e le attività sono dirette. Tra gli usi suggeriti da Google figurano la gestione preliminare delle richieste di assistenza clienti, l’esercizio delle lingue, la ricerca vocale e la narrazione interattiva. Google indica inoltre come attività adatte le azioni esterne rapide, come leggere i valori dei sensori o controllare dispositivi intelligenti.

Con il modello standard, ogni turno dell’utente produce un’unica risposta del modello. Un segnale turnComplete: true indica che il modello ha finito di parlare e che la sessione è inattiva. Google afferma che il modello adotta un approccio di ragionamento intercalato con un profilo di latenza fisso; non supporta un thinking_level configurabile.

Extended Thinking cambia il ciclo di vita della sessione

gemini-3.8-live-extended-thinking è pensato per agenti vocali che devono esaminare informazioni complesse, pianificare più passaggi o attendere strumenti esterni. Tra gli usi documentati figurano gli agenti di supporto che esaminano registri, codici di errore e verifiche della configurazione; gli agenti di viaggio e prenotazione che cercano voli e hotel; e i sistemi di tutoraggio che verificano formule o correggono errori nel codice prima di rispondere.

Invece di lasciare chi chiama ad attendere in silenzio mentre è in funzione uno strumento, il modello Extended Thinking può fornire aggiornamenti intermedi a voce. Per descrivere questo comportamento, la documentazione di Google usa l’esempio «Controllo ora le opzioni di volo». Il modello può continuare a elaborare in background, effettuare chiamate asincrone agli strumenti e fornire una risposta vocale finale una volta completata l’attività più ampia.

In una sessione Extended Thinking, il segnale turnComplete: true ha quindi un significato più circoscritto. Può indicare la fine di una singola enunciazione, compreso un aggiornamento vocale intermedio, senza segnalare che tutto il ragionamento e il lavoro degli strumenti sono terminati. I client devono monitorare anche interaction_status.

Lo stato IN_PROGRESS indica che il server sta ancora elaborando la richiesta dell’utente, svolgendo ragionamenti in background o attendendo la risposta di uno strumento asincrono. Lo stato IDLE indica che l’elaborazione, il ragionamento e le chiamate agli strumenti sono terminati e che la sessione è pronta a ricevere altri input dall’utente. Le applicazioni che mostrano uno stato di ascolto o decidono quando accettare un’altra richiesta devono quindi basarsi sullo stato dell’interazione, anziché fare affidamento soltanto sul segnale di completamento del turno.

Requisiti diversi per la configurazione e gli strumenti

Google consente agli sviluppatori di configurare la profondità del ragionamento del modello Extended Thinking con i valori low, medium o high per thinking_level. L’impostazione MINIMAL non è supportata. Le dichiarazioni di funzioni per questo modello devono usare il comportamento non bloccante, NON_BLOCKING; Google afferma che le funzioni sincrone bloccanti restituiscono un errore.

Questo richiede ai client di gestire più messaggi nell’ambito di quella che per l’utente è un’unica richiesta. Una sessione può ricevere una risposta audio intermedia, una chiamata a uno strumento, la risposta dello strumento e una risposta finale. La documentazione afferma che i client dovrebbero continuare ad ascoltare dopo un segnale turnComplete: true se interaction_status è ancora IN_PROGRESS.

Le indicazioni di Google per la migrazione indicano gemini-3.1-flash-live-preview come un precedente modello della Live API. Per trasferire un’applicazione esistente a gemini-3.8-live occorre modificare la stringa del modello e omettere thinking_level o thinking_config dalla configurazione del modello standard. Le applicazioni che adottano Extended Thinking devono aggiungere la gestione dello stato, configurare strumenti non bloccanti e tenere conto degli output vocali intermedi.

La distinzione lascia agli sviluppatori una scelta su quale modello usare: Gemini 3.8 Live per turni di conversazione rapidi e comandi diretti, oppure Gemini 3.8 Live Extended Thinking quando un’interazione vocale richiede un ragionamento più approfondito e attività esterne di più lunga durata.

Fonte

Esplora

Altri articoli