Vai al contenuto
AI.info

Ricerca

Fidarsi o non fidarsi: verifica dei fatti basata sul recupero di informazioni nel parlato

La disinformazione online compare sempre più spesso in formati orali come clip di notizie, podcast, interviste, discorsi politici e video sui social media, rendendo necessari sistemi di verifica dei f

Fidarsi o non fidarsi: verifica dei fatti basata sul recupero di informazioni nel parlato
arXiv
2609.30227
Pubblicato
2026-09-24
Autori
Debajyoti Mazumder, Mamta, Abhirama Subramanyam Penamakuri

Abstract degli autori

La disinformazione online compare sempre più spesso in formati orali come clip di notizie, podcast, interviste, discorsi politici e video sui social media, rendendo necessari sistemi di verifica dei fatti in grado di verificare le affermazioni direttamente a partire dal parlato. Presentiamo VeriSpeak, un benchmark esplorativo per studiare la verifica dei fatti nel parlato con i modelli linguistici audio di grandi dimensioni (LALMs). VeriSpeak contiene 3.879 affermazioni pronunciate, relative a fatti temporali, geografici e relazionali, con un numero bilanciato di etichette «vero» e «falso». Il benchmark è stato progettato per esaminare se la capacità di verificare i fatti si trasferisca dal testo al parlato e se i LALMs potenziati dal recupero di informazioni siano in grado di usare prove testuali per confermare o confutare correttamente le affermazioni pronunciate. I nostri esperimenti rivelano una costante disparità tra testo e parlato: i LALMs che verificano in modo affidabile le affermazioni scritte spesso falliscono quando le stesse affermazioni vengono pronunciate. Inoltre, il solo recupero di informazioni produce miglioramenti limitati, perché i modelli spesso confondono le prove recuperate con l’affermazione pronunciata. Al contrario, combinare il recupero di informazioni con un ragionamento esplicito migliora il confronto tra affermazioni e prove: un LALM ottimizzato per il ragionamento raggiunge un’accuratezza dell’86,1%. VeriSpeak mette in luce che per rilevare efficacemente la disinformazione nel parlato non basta comprendere il parlato: servono anche ragionamenti fondati sulle prove recuperate. Il dataset è disponibile pubblicamente su Hugging Face all’indirizzo https://huggingface.co/datasets/abhiram4572/VeriSpeak.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv