Vai al contenuto
AI.info

The Pulse

SpaceXAI presenta Grok Voice Transcribe 2.0 allo stesso prezzo

SpaceXAI afferma che Grok Voice Transcribe 2.0 raddoppia la precisione del predecessore nelle valutazioni nel mondo reale, mantenendo invariati i prezzi per batch e streaming.

SpaceXAI presenta Grok Voice Transcribe 2.0 allo stesso prezzo

AI.info Team ·

Il 18 settembre SpaceXAI ha presentato Grok Voice Transcribe 2.0, descrivendolo come un aggiornamento in termini di accuratezza per i flussi di lavoro di conversione da parlato a testo, senza aumentare il prezzo pubblicato. Secondo l’azienda, nelle valutazioni condotte in condizioni reali il modello è due volte più accurato di Grok Voice Transcribe 1.0.

Grok Voice Transcribe 2.0 è disponibile per la trascrizione in batch e in streaming tramite l’API Speech-to-Text di SpaceXAI. La trascrizione in batch resta a 0,10 dollari per ora di audio, mentre quella in streaming costa 0,20 dollari per ora. Secondo SpaceXAI, a queste tariffe sono inclusi diarizzazione, timestamp e termini chiave.

Grok Voice Transcribe 2.0 punta sull’audio rumoroso

SpaceXAI ha sviluppato il modello a partire dal modello fondazionale audio alla base di Grok Voice. Secondo l’azienda, quel sistema gestisce già decine di migliaia di chiamate al servizio clienti ogni giorno, trascrive milioni di ore di narrazioni video e alimenta agenti vocali in prodotti fisici, tra cui l’assistente Grok nei veicoli Tesla.

Il nuovo modello è stato addestrato su audio dal vivo, rumoroso e multilingue, raccolto in ambienti diversi. SpaceXAI cita in particolare linee telefoniche instabili, interlocutori che parlano contemporaneamente, accenti regionali e numeri di telefono o indirizzi email pronunciati a voce come condizioni che mettono in luce i punti deboli dei sistemi ottimizzati soprattutto per registrazioni nitide con un solo interlocutore.

Nella classifica pubblica di Artificial Analysis, secondo SpaceXAI Grok Voice Transcribe 2.0 è al primo posto per accuratezza tra 32 modelli in streaming. Si tratta della descrizione che l’azienda dà della posizione in classifica, non di un test indipendente pubblicato insieme al lancio.

Le frasi brevi in più lingue mostrano il miglioramento maggiore

SpaceXAI riferisce miglioramenti rispetto alla versione 1.0 su quattro set di valutazione interni: audio telefonico in inglese a 8 kHz tratto da chiamate al servizio clienti, conversazioni in inglese con Grok, credenziali pronunciate come codici di account e indirizzi email, e brevi comandi vocali in 19 lingue.

Il miglioramento più ampio riportato riguarda le frasi brevi in più lingue, per le quali il modello deve identificare una lingua con poco contesto circostante. SpaceXAI afferma che, su questo set, il tasso di errore delle parole scende dal 20,6% con Grok Voice Transcribe 1.0 al 6,8% con la versione 2.0. Un tasso di errore delle parole più basso indica un numero minore di errori di trascrizione.

Il modello è in grado di trascrivere decine di lingue, rilevare automaticamente la lingua e seguire i cambi di lingua all’interno della stessa registrazione. SpaceXAI descrive l’accuratezza multilingue come il miglioramento più significativo rispetto alla versione precedente.

Loom e Cursor protagonisti del flusso di lavoro esemplificativo di SpaceXAI

SpaceXAI mostra come una trascrizione migliore possa alimentare altri software attraverso un flusso di lavoro che coinvolge Loom di Atlassian e lo strumento di programmazione Cursor. Un utente può registrare un piano d’azione in Loom, inviare la trascrizione a Cursor e usare il contesto ottenuto per apportare modifiche al codice.

«Abbiamo sempre creduto che il modo migliore per portare avanti il lavoro sia acquisire il contesto una sola volta e lasciarlo fluire ovunque. Con Grok che alimenta la conversione da parlato a testo di Loom e Cursor che la trasforma in codice, chiudiamo il cerchio tra contesto e codice: registra ciò che intendi e il lavoro viene fatto. È uno sguardo a dove è diretto lo sviluppo assistito dall’IA.»

Sanchan Saxena, vicepresidente senior di Teamwork Collection, Atlassian

L’esempio riflette una scelta di prodotto più ampia alla base del lancio: SpaceXAI propone la trascrizione come livello di input per altre applicazioni, non solo come generatore autonomo di trascrizioni. L’elaborazione in batch gestisce file registrati e URL, mentre lo streaming supporta l’audio dal vivo tramite l’API.

La versione 1.0 sarà ritirata durante la migrazione

Le integrazioni esistenti con l’API Speech-to-Text beneficiano del miglioramento in termini di accuratezza senza richiedere modifiche al codice. SpaceXAI afferma che Grok Voice Transcribe 2.0 diventerà presto il modello predefinito nell’API Speech-to-Text, mentre Grok Voice Transcribe 1.0 sarà ritirato nelle prossime settimane.

Gli sviluppatori che durante la transizione devono continuare a usare il modello precedente possono fissare grok-voice-transcribe-1.0.

La scelta commerciale di SpaceXAI è semplice: gli sviluppatori ricevono un nuovo modello di trascrizione alle tariffe esistenti, mentre il cambiamento tecnico riguarda l’accuratezza con audio telefonico, credenziali pronunciate, comandi multilingue e altre condizioni difficili da gestire in modo affidabile.

Fonte

Esplora

Altri articoli