Vai al contenuto
AI.info

The Pulse

OpenAI lancia il modello vocale GPT-Live-1 nella sua API

OpenAI ha rilasciato GPT-Live-1 nella sua API, offrendo agli sviluppatori un modello vocale full-duplex capace di ascoltare e parlare contemporaneamente. Il modello supporta la gestione delle interruzioni, la telefonia, il ragionamento dele

OpenAI lancia il modello vocale GPT-Live-1 nella sua API

AI.info Team ·

In una prima valutazione, le interruzioni sono diminuite di quasi l’80%. OpenAI afferma che è quanto accaduto quando chi studia le lingue ha usato GPT-Live-1 al posto di un sistema vocale convenzionale basato sui turni, in cui l’assistente aspetta che l’utente abbia finito di parlare prima di rispondere.

OpenAI ha rilasciato GPT-Live-1 nella sua API il 10 settembre 2026, portando il modello vocale di ChatGPT agli sviluppatori che realizzano applicazioni vocali per il servizio clienti, le ripetizioni, la telefonia e altri ambiti. Il modello ascolta e parla contemporaneamente, mentre modelli separati sul backend possono occuparsi di ragionamenti più approfonditi, ricerche sul web e chiamate agli strumenti.

La novità offre agli sviluppatori un maggiore controllo sul suono e sul comportamento di un assistente vocale, ma segna anche un cambiamento tecnico nel modo in cui OpenAI prevede di assemblare i sistemi vocali. Invece di collegare riconoscimento vocale, un modello linguistico e sintesi vocale a ogni scambio, gli sviluppatori possono usare GPT-Live-1 come livello vocale continuo e collegarlo ai modelli e ai sistemi software che operano dietro di esso.

GPT-Live-1 continua a parlare mentre lavorano altri modelli

Gli agenti vocali tradizionali elaborano le conversazioni in sequenza: prima il riconoscimento vocale, poi il ragionamento e infine la sintesi vocale. Ogni passaggio può aggiungere ritardi o far perdere informazioni su pause, tono e interruzioni. GPT-Live-1, invece, elabora insieme l’audio in entrata e quello in uscita, così può continuare ad ascoltare mentre parla e rispondere quando l’utente cambia direzione.

OpenAI afferma che il modello può delegare i compiti più complessi a un modello testuale sul backend, come GPT-6 Astra, o a un modello di terze parti. Questa suddivisione permette a GPT-Live-1 di mantenere la conversazione in tempo reale mentre un altro sistema effettua ricerche, ragiona su una richiesta complessa o richiama uno strumento aziendale. Gli sviluppatori possono scegliere il modello backend, gli strumenti e il sistema di orchestrazione, invece di vincolare ogni parte dell’applicazione a un solo modello.

L’API fornisce anche trascrizioni automatiche del riconoscimento vocale e il testo delle risposte, supporta la priorità delle parole chiave e include il rilevamento nativo dei turni per le applicazioni che hanno ancora bisogno di confini espliciti tra gli interventi. OpenAI afferma che GPT-Live-1 gestisce rumori di fondo e silenzi in modo più discreto, evitando commenti vocali superflui quando l’utente si ferma a riflettere.

OpenAI segnala un miglioramento di 30 punti nei test full-duplex

OpenAI riferisce che GPT-Live-1 ha migliorato di 30 punti percentuali il proprio punteggio al Full Duplex Bench rispetto a GPT-Realtime-2.1. Secondo l’azienda, i progressi maggiori riguardano la latenza nella gestione dei turni e il comportamento interattivo, comprese pause, interruzioni, segnali di assenso e voci in sottofondo.

Nei primi test condotti da Speak, un’azienda che si occupa di apprendimento delle lingue, GPT-Live-1 ha ridotto di quasi l’80% le interruzioni durante le pause di riflessione degli studenti, rispetto ai precedenti sistemi basati sui turni. OpenAI afferma inoltre che GPT-Live-1 abbinato a GPT-6 Astra con un livello medio di ragionamento si è classificato al primo posto nella sua valutazione Tau3 dei compiti end-to-end degli agenti vocali.

«L’integrazione di GPT-Live-1 in Yelp Host e Hatch ha migliorato la gestione dei turni e la precisione rispetto alla nostra architettura vocale tradizionale. Quando Yelp Host usa GPT-Live-1 per rispondere alle chiamate, per esempio per prenotazioni e ordini di cibo, stiamo registrando miglioramenti significativi nei tassi di gestione delle chiamate.»

Alex Levy, direttore tecnico di Yelp

I risultati provengono dalle valutazioni interne di OpenAI e dai riscontri dei partner, non da un benchmark indipendente. Indicano il problema specifico a cui punta l’azienda: sistemi vocali capaci di capire quando qualcuno sta ancora riflettendo, accettare un’interruzione e proseguire la conversazione senza costringere chi chiama ad aspettare che la risposta sia terminata.

Telefonia e una scelta più ampia di voci

GPT-Live-1 supporta agenti vocali full-duplex per le telefonate, compresi casi d’uso come le prenotazioni al ristorante e l’assistenza clienti. Nell’annuncio, OpenAI cita Yelp, Speak, Fin e Cognition tra le aziende che usano o stanno valutando il modello.

La novità amplia anche la scelta di voci disponibili, oltre il piccolo gruppo di voci in tempo reale. Gli sviluppatori possono scegliere tra voci come Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta e Cinder; OpenAI promette altre lingue e opzioni vocali nei prossimi mesi.

Tra gli esempi proposti da OpenAI c’è anche il collegamento di GPT-Live-1 a Codex. In questa configurazione, il modello vocale riceve la richiesta pronunciata dall’utente, invia a Codex il contesto pertinente e riporta la risposta risultante nella conversazione in tempo reale. Il progetto separa lo scambio audio dall’attività software, più lunga, così una chiamata lenta a uno strumento non deve interrompere la conversazione.

L’API parte da cinque centesimi al minuto

GPT-Live-1 è disponibile nell’API a 0,05 dollari al minuto per il livello vocale front-end. OpenAI afferma che gli sviluppatori possono abbinarlo al modello backend e allo stack applicativo più adatti al loro prodotto: la tariffa pubblicata, quindi, non rappresenta il costo totale di un agente vocale che utilizza anche modelli di ragionamento, strumenti, servizi di telefonia o sistemi aziendali.

OpenAI offre anche un’opzione gestita per le aziende tramite OpenAI Presence, che usa GPT-Live-1 per interazioni vocali in grado di rispondere alle domande, accedere ai sistemi aziendali, intraprendere azioni autorizzate e trasferire la chiamata al personale. Per accedere alle voci personalizzate occorre contattare il team commerciale di OpenAI.

Con il rilascio di GPT-Live-1 nell’API, la principale funzionalità del modello in ChatGPT diventa una piattaforma per sviluppatori: conversazione continua in primo piano, calcoli più approfonditi dietro le quinte e supporto telefonico quando un’applicazione deve raggiungere gli utenti al di fuori di una finestra di chat. La prova immediata per OpenAI sarà capire se la minore latenza e il livello vocale più semplice si traducono in chiamate affidabili al prezzo effettivamente pagato dagli sviluppatori, una volta inclusi i costi del backend.

Fonte

Esplora

Altri articoli