The Pulse
Microsoft lancia modelli vocali in streaming per gli agenti vocali
Microsoft ha lanciato MAI-Transcribe-2-Streaming, che aggiorna in tempo reale le trascrizioni in 60 lingue, insieme a due modelli multilingue per la generazione vocale. I modelli sono disponibili tramite Microsoft Foundry e MAI Playground;

AI.info Team ·
Il nuovo modello di trascrizione in streaming di Microsoft è progettato per fornire agli agenti vocali testo utilizzabile prima che chi chiama abbia finito di parlare. Annunciato il 1° ottobre, MAI-Transcribe-2-Streaming invia le prime ipotesi di trascrizione poco più di 100 millisecondi dopo aver ricevuto l’audio, le aggiorna man mano che arrivano altre parole e poi conferma una versione stabile.
Le trascrizioni parziali permettono agli agenti di agire mentre l’interlocutore parla
Il modello trascrive il parlato in 60 lingue e rileva automaticamente la lingua mentre la conversazione prosegue. Secondo Microsoft, i primi aggiornamenti della trascrizione possono permettere a un agente di iniziare a ragionare o di chiamare uno strumento mentre l’interlocutore sta ancora parlando, anziché attendere che abbia finito di esprimersi.
Per la dettatura e la sottotitolazione in tempo reale, Microsoft afferma che, nelle valutazioni interne, le parole sono apparse nella trascrizione due volte più velocemente rispetto al concorrente più vicino. L’annuncio del lancio non identifica il concorrente né descrive le modalità della valutazione: il confronto resta quindi un risultato riportato dall’azienda, non un test comparativo pienamente documentato.
Microsoft afferma che MAI-Transcribe-2-Streaming è al primo posto per accuratezza sia nelle trascrizioni definitive sia in quelle parziali nelle valutazioni di Artificial Analysis. Il precedente annuncio di MAI-Transcribe-2 riguardava un modello di trascrizione batch, non questa versione in streaming: l’azienda aveva fissato il prezzo di quel modello a 0,10 dollari per ora di audio, mentre la nuova versione in streaming ha una tariffa introduttiva di 0,54 dollari l’ora fino alla fine del 2026.
Due modelli vocali completano l’offerta audio di Microsoft
Microsoft ha presentato anche MAI-Voice-2.1 e MAI-Voice-2.1-Flash, entrambi modelli di sintesi vocale a partire da testo. La versione standard supporta 23 lingue in 26 varianti locali. Secondo Microsoft, una stessa voce può mantenere la propria identità parlando con un accento nativo in lingue diverse; il prezzo indicato è di 22 dollari per milione di caratteri.
Flash è pensato per impieghi ad alto volume e sensibili alla latenza, come le risposte vocali degli agenti. Microsoft afferma che può generare 45 secondi di audio con una latenza end-to-end di 150 millisecondi, offre un’inferenza del modello più rapida del 55% e costa circa il 60% in meno rispetto a modelli comparabili; il prezzo indicato è di 15 dollari per milione di caratteri.
Entrambi i modelli vocali possono clonare una voce nelle lingue supportate a partire da pochi secondi di audio di riferimento. Microsoft afferma che includono misure di tutela del consenso, ma il suo annuncio non spiega come funzionino queste misure né quali verifiche i clienti debbano completare prima di usare una voce clonata.
Dove gli sviluppatori possono provare i modelli
Microsoft elenca tutti e tre i modelli in Microsoft Foundry e nel MAI Playground e afferma che sono disponibili anche tramite Vercel e Azure Voice Live. OpenRouter offre i due modelli vocali, mentre il supporto per LiveKit è indicato come disponibile a breve.
Il lancio abbina la trascrizione in tempo reale alla generazione vocale, offrendo agli sviluppatori componenti separati per le funzioni di ascolto e di risposta parlata di un agente. Questo può ridurre i tempi tra le parole di un utente e la risposta di un agente, ma i tempi pubblicati e le affermazioni comparative provengono da Microsoft; l’annuncio non fornisce una misurazione end-to-end completa per un agente funzionante che comprenda anche il ragionamento e le chiamate agli strumenti.