Vai al contenuto
AI.info

The Pulse

Humyn Labs mette alla prova 23 modelli ASR con il parlato sovrapposto

Il benchmark BRIDGE ASR 2.0 di Humyn Labs valuta 23 modelli commerciali di riconoscimento vocale su conversazioni spontanee con parlato sovrapposto, in 21 lingue e secondo sei metriche.

Humyn Labs mette alla prova 23 modelli ASR con il parlato sovrapposto

AI.info Team ·

Humyn Labs ha pubblicato BRIDGE ASR 2.0, un benchmark che mette alla prova 23 modelli commerciali di riconoscimento vocale con registrazioni del tipo che i test di laboratorio in condizioni controllate spesso evitano: conversazioni spontanee tra due persone, rumori di fondo, alternanza tra lingue, pause lunghe e persone che parlano contemporaneamente.

La citazione bibliografica del benchmark lo identifica come un rapporto del settembre 2026. La valutazione si basa su registrazioni di conversazioni reali anziché su dettati di un solo parlante. La sua classifica ordina i sistemi secondo sei misure, tra cui tasso di errore sulle parole, somiglianza semantica, alternanza tra lingue e perdita di informazioni sulle parole.

Il benchmark è progettato per verificare se i sistemi di riconoscimento vocale riescono a conservare le informazioni utili quando le persone non parlano a turni ordinati e separati.

BRIDGE usa conversazioni invece di dettati

Ogni registrazione del benchmark comprende due parlanti e autentiche sovrapposizioni tra le loro voci. Secondo Humyn Labs, le conversazioni durano da 10 a 15 minuti e sono state registrate a 44–48 kHz in ambienti acustici quotidiani. L’azienda presenta il dataset come un test del riconoscimento in streaming e della separazione dei parlanti, due attività che possono fallire quando le voci si sovrappongono.

Il campione comprende 18 lingue indiche, oltre allo spagnolo latinoamericano, al portoghese brasiliano e al vietnamita. Humyn Labs classifica le registrazioni secondo sette dimensioni relative ai gruppi di appartenenza, consentendo agli utenti di confrontare i risultati per lingua, regione, silenzio, dinamiche della conversazione e altre condizioni, anziché affidarsi a un’unica media complessiva.

L’insieme delle sei metriche combina tasso di errore sulle parole, tasso di errore sui caratteri, somiglianza semantica, F1 per l’alternanza tra lingue, tasso di errore basato sui fonemi e informazioni perse sulle parole. L’azienda distingue inoltre tra sostituzioni, omissioni e inserimenti. La distinzione conta: un modello può capire male una parola, omettere un intero segmento o aggiungere parole mai pronunciate nella registrazione, pur producendo tassi di errore complessivi simili.

ElevenLabs guida la classifica delle lingue indiche

ElevenLabs Scribe v2 occupa il primo posto nella classifica del rapporto per le lingue indiche, con un tasso di errore sulle parole corretto per i prestiti linguistici del 10,99%. Segue Soniox stt-async-v4 al 16,32%, con uno scarto di 5,3 punti percentuali. Secondo Humyn Labs, Scribe v2 è primo in 14 delle 18 lingue indiche testate.

Più in basso nella classifica, le differenze sono molto più ampie. I sei modelli più deboli per le lingue indiche registrano tassi di errore corretti per i prestiti linguistici compresi tra il 70,77% e l’88,03%. GPT-4o e GPT-4o mini di OpenAI si collocano verso il fondo della classifica mostrata, mentre AssemblyAI Universal, Universal 2 e Universal 3 Pro si trovano ancora più in basso.

I risultati sono più ravvicinati nel gruppo delle lingue scritte con alfabeto latino. Scribe v2 registra un tasso di errore sulle parole del 4,83% per spagnolo, portoghese e vietnamita, contro l’8,14% di Microsoft MAI Transcribe 1.5. L’intervallo complessivo va dal 4,83% al 22,10%: quando più sistemi producono trascrizioni utilizzabili, latenza, prezzi e copertura linguistica restano quindi fattori importanti nella scelta del sistema da impiegare.

Le pause lunghe fanno più danni dei rapidi cambi di turno

Una delle conclusioni più chiare di BRIDGE riguarda il silenzio. Tenendo conto della lingua e del modello, le chiamate con pause superiori a 20 secondi mostrano una perdita media di 5,05 punti nell’accuratezza corretta per i prestiti linguistici. I rapidi cambi di turno comportano una penalizzazione media minore, pari a 1,33 punti.

La tendenza emerge nella maggior parte dei modelli testati con prestazioni adeguate. Google Chirp 3 perde 13,22 punti in presenza di pause lunghe, contro 6,69 punti dovuti al parlato rapido. Gemini 2.5 Pro perde 10,87 punti per le pause lunghe e 2,16 punti per la velocità, mentre Scribe v2 perde rispettivamente 7,50 e 0,79 punti.

Humyn Labs attribuisce la probabile causa del problema alla segmentazione, più che al riconoscimento di base. Le pause lunghe sono concentrate nel marwari, già la lingua più difficile tra quelle indiche esaminate. Senza tenere conto della lingua, la penalizzazione apparentemente dovuta al silenzio sale a 16,33 punti, sovrastimando l’effetto del solo silenzio.

L’alternanza tra lingue rivela un secondo divario di qualità

BRIDGE misura anche se i sistemi conservano le parole inglesi inserite in discorsi in lingue indiche. Humyn Labs sostiene che il normale tasso di errore sulle parole possa nascondere una differenza importante: un modello può conservare il termine inglese ma scriverlo in una grafia locale, oppure eliminarlo del tutto.

ElevenLabs Scribe v2 guida la misura dell’alternanza tra lingue con un punteggio CS F1 di 0,897, seguito da Gemini 3 Pro a 0,891 e Gemini 3 Flash a 0,886. AssemblyAI Universal registra 0,157, collocandosi nella categoria dei modelli che non gestiscono l’alternanza tra lingue definita dal rapporto. Secondo Humyn Labs, 15 modelli ottengono un punteggio di almeno 0,7, mentre sette si collocano tra 0,2 e 0,7.

Il benchmark distingue le incongruenze nella grafia dalle parole mancanti. Sarvam saarika v2.5, Sarvam saaras v3, AWS Transcribe, Google Chirp 3 e Soniox mostrano penalizzazioni legate alla grafia, pur mantenendo una precisione di circa il 90–95% nell’alternanza tra lingue. Humyn Labs descrive questo problema come potenzialmente risolvibile tramite un confronto che tenga conto della traslitterazione; una parola che scompare del tutto non può essere recuperata allo stesso modo.

Un benchmark pensato per decidere a quale modello affidare l’elaborazione

I risultati di BRIDGE mettono in discussione l’utilità di un’unica classifica universale. Humyn Labs riferisce che le differenze tra i file spiegano il 36,1% della variazione nel tasso di errore corretto per i prestiti linguistici tra i modelli per le lingue indiche con prestazioni adeguate, contro il 25,0% attribuibile alla lingua e il 14,6% al modello stesso. La correlazione mediana tra i punteggi delle coppie di modelli è 0,42, a indicare che i sistemi incontrano spesso difficoltà con registrazioni diverse.

Il set di valutazione, che comprende file audio, trascrizioni di riferimento, metadati sui parlanti, etichette dei gruppi e script per il calcolo dei punteggi, è disponibile sulla pagina del benchmark. Humyn Labs afferma che sono in preparazione altre lingue e un corpus incentrato sulla sovrapposizione delle voci. Per gli sviluppatori che realizzano sistemi di trascrizione delle chiamate, interfacce vocali o sistemi di riconoscimento vocale per dispositivi fisici, il valore immediato non sta semplicemente nell’individuare un vincitore, ma nel capire se un modello omette parole pronunciate, ne inventa altre, gestisce male il silenzio o perde i termini inglesi di cui ha bisogno il software che elabora i risultati.

Fonte

Esplora

Altri articoli