Vai al contenuto
AI.info

Ricerca

VākQA: un benchmark e uno studio di valutazione per la risposta a domande fattuali poste oralmente in telugu

La risposta alle domande ha compiuto rapidi progressi grazie ai modelli linguistici di grandi dimensioni, ma soprattutto per le lingue con abbondanti risorse, sia nel testo sia nel parlato. I benchmar

VākQA: un benchmark e uno studio di valutazione per la risposta a domande fattuali poste oralmente in telugu
arXiv
2609.19879
Pubblicato
2026-09-17
Autori
Bhavana Akkiraju, Ravi Sastry Kolluru, Sri Charan D, Srihari Bandarupalli, Santosh Kesiraju, Anil Vuppala

Abstract degli autori

La risposta alle domande ha compiuto rapidi progressi grazie ai modelli linguistici di grandi dimensioni, ma soprattutto per le lingue con abbondanti risorse, sia nel testo sia nel parlato. I benchmark per la risposta a domande poste oralmente in telugu restano inesplorati, e l’affidabilità della valutazione automatica in questo ambito non è stata quantificata. Presentiamo VākQA, un benchmark per la risposta a domande poste oralmente in telugu composto da 2.001 coppie di domande e risposte fattuali in sei ambiti, con 2,53 ore di registrazioni vocali, trascrizioni bilingui e risposte di riferimento verificate da esseri umani. Per prima cosa convalidiamo i metodi di valutazione confrontandoli con i giudizi umani: Gemini nel ruolo di giudice è quello che si avvicina di più alle valutazioni umane, ma applica criteri di severità non uniformi, mentre i modelli giudici a pesi aperti penalizzano sistematicamente le risposte corrette in telugu che differiscono dalla risposta di riferimento nella forma espressiva. Usando questa impostazione convalidata, valutiamo con il benchmark modelli proprietari e a pesi aperti in base alla modalità di input, alla lingua e all’ambito. Osserviamo che la formulazione in telugu conserva specificità culturali che si perdono nella traduzione, che l’input vocale introduce confusioni fonetiche capaci di alterare il significato delle domande e che gli errori nella sequenza ASR-MT si accumulano progressivamente. VākQA è stato reso pubblico.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv