Vai al contenuto
AI.info

Ricerca

Realizzare un sistema di riconoscimento vocale greco-inglese per l’uso in produzione

Presentiamo un programma di sviluppo durato diversi mesi per realizzare Sophea, un sistema di riconoscimento automatico del parlato bilingue greco-inglese destinato all’uso in produzione. Valutiamo il

Realizzare un sistema di riconoscimento vocale greco-inglese per l’uso in produzione
arXiv
2609.13498
Pubblicato
2026-09-11
Autori
Christos Petrocheilos, Cleopatra Papadopoulou, Chris Porikis, Ioakeim Perros, Ayoub Kirouane, Themistoklis Nikolis

Abstract degli autori

Presentiamo un programma di sviluppo durato diversi mesi per realizzare Sophea, un sistema di riconoscimento automatico del parlato bilingue greco-inglese destinato all’uso in produzione. Valutiamo il sistema rispetto a nove criteri per la messa in produzione, che riguardano il tasso di errore sulle parole in greco e in inglese, l’identificazione della lingua e le allucinazioni su audio privo di parlato. Nel corso di ventitré iterazioni di addestramento e con due architetture di modello, nessuna composizione dei dati di addestramento ha soddisfatto contemporaneamente tutti e nove i criteri. Per raggiungere l’obiettivo fissato per il greco in ambienti rumorosi erano necessari circa 1.500 step di esposizione intensiva ai dati del dominio, mentre per preservare l’identificazione dell’inglese erano tollerabili solo circa 250 step, oppure circa 1.250 con una miscela di dati riequilibrata che riduceva l’accuratezza sul greco. Descriviamo una pipeline di dati in sei fasi in cui la calibrazione di un filtro per la qualità dell’audio rispetto a campioni di riferimento del dominio ha ridotto la quota scartata dell’audio greco valutato dal 98,7% al 10,6%. Uno studio di ablazione preregistrato ha ricondotto un difetto di allucinazione a un singolo pacchetto di dati di addestramento. Un ensemble ROVER di tre modelli ha portato il numero di criteri soddisfatti da 4-7 su 9 per i singoli modelli a 9 su 9 e ha ridotto il tasso di errore sulle parole (WER) nel parlato sovrapposto dal 53,35% al 37,87%, un miglioramento relativo del 29%. Un sistema di selezione distinto, appreso per singola clip e basato su due modelli, figura come sophea/asr-k1 (preview) nella classifica pubblica Open ASR Leaderboard, con un WER medio del 4,26% su otto set di test pubblici in inglese, e raggiunge un WER del 25,88% sul traffico reale in greco proveniente da ambienti rumorosi. Documentiamo inoltre cinque casi in cui uno strumento di misurazione ha prodotto un risultato plausibile ma errato e sette approcci sostanziali che sono stati valutati ma non distribuiti. Non rendiamo disponibili né i pesi dei modelli né i dati di addestramento; riportiamo soltanto la metodologia e i risultati quantitativi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv