Ricerca
Realizzare un sistema di riconoscimento vocale greco-inglese per l’uso in produzione
Presentiamo un programma di sviluppo durato diversi mesi per realizzare Sophea, un sistema di riconoscimento automatico del parlato bilingue greco-inglese destinato all’uso in produzione. Valutiamo il

- arXiv
- 2609.13498
- Pubblicato
- 2026-09-11
- Autori
- Christos Petrocheilos, Cleopatra Papadopoulou, Chris Porikis, Ioakeim Perros, Ayoub Kirouane, Themistoklis Nikolis
Abstract degli autori
Presentiamo un programma di sviluppo durato diversi mesi per realizzare Sophea, un sistema di riconoscimento automatico del parlato bilingue greco-inglese destinato all’uso in produzione. Valutiamo il sistema rispetto a nove criteri per la messa in produzione, che riguardano il tasso di errore sulle parole in greco e in inglese, l’identificazione della lingua e le allucinazioni su audio privo di parlato. Nel corso di ventitré iterazioni di addestramento e con due architetture di modello, nessuna composizione dei dati di addestramento ha soddisfatto contemporaneamente tutti e nove i criteri. Per raggiungere l’obiettivo fissato per il greco in ambienti rumorosi erano necessari circa 1.500 step di esposizione intensiva ai dati del dominio, mentre per preservare l’identificazione dell’inglese erano tollerabili solo circa 250 step, oppure circa 1.250 con una miscela di dati riequilibrata che riduceva l’accuratezza sul greco. Descriviamo una pipeline di dati in sei fasi in cui la calibrazione di un filtro per la qualità dell’audio rispetto a campioni di riferimento del dominio ha ridotto la quota scartata dell’audio greco valutato dal 98,7% al 10,6%. Uno studio di ablazione preregistrato ha ricondotto un difetto di allucinazione a un singolo pacchetto di dati di addestramento. Un ensemble ROVER di tre modelli ha portato il numero di criteri soddisfatti da 4-7 su 9 per i singoli modelli a 9 su 9 e ha ridotto il tasso di errore sulle parole (WER) nel parlato sovrapposto dal 53,35% al 37,87%, un miglioramento relativo del 29%. Un sistema di selezione distinto, appreso per singola clip e basato su due modelli, figura come sophea/asr-k1 (preview) nella classifica pubblica Open ASR Leaderboard, con un WER medio del 4,26% su otto set di test pubblici in inglese, e raggiunge un WER del 25,88% sul traffico reale in greco proveniente da ambienti rumorosi. Documentiamo inoltre cinque casi in cui uno strumento di misurazione ha prodotto un risultato plausibile ma errato e sette approcci sostanziali che sono stati valutati ma non distribuiti. Non rendiamo disponibili né i pesi dei modelli né i dati di addestramento; riportiamo soltanto la metodologia e i risultati quantitativi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv