Ricerca
Fidarsi o non fidarsi: verifica dei fatti basata sul recupero di informazioni nel parlato
La disinformazione online compare sempre più spesso in formati orali come clip di notizie, podcast, interviste, discorsi politici e video sui social media, rendendo necessari sistemi di verifica dei f

- arXiv
- 2609.30227
- Pubblicato
- 2026-09-24
- Autori
- Debajyoti Mazumder, Mamta, Abhirama Subramanyam Penamakuri
Abstract degli autori
La disinformazione online compare sempre più spesso in formati orali come clip di notizie, podcast, interviste, discorsi politici e video sui social media, rendendo necessari sistemi di verifica dei fatti in grado di verificare le affermazioni direttamente a partire dal parlato. Presentiamo VeriSpeak, un benchmark esplorativo per studiare la verifica dei fatti nel parlato con i modelli linguistici audio di grandi dimensioni (LALMs). VeriSpeak contiene 3.879 affermazioni pronunciate, relative a fatti temporali, geografici e relazionali, con un numero bilanciato di etichette «vero» e «falso». Il benchmark è stato progettato per esaminare se la capacità di verificare i fatti si trasferisca dal testo al parlato e se i LALMs potenziati dal recupero di informazioni siano in grado di usare prove testuali per confermare o confutare correttamente le affermazioni pronunciate. I nostri esperimenti rivelano una costante disparità tra testo e parlato: i LALMs che verificano in modo affidabile le affermazioni scritte spesso falliscono quando le stesse affermazioni vengono pronunciate. Inoltre, il solo recupero di informazioni produce miglioramenti limitati, perché i modelli spesso confondono le prove recuperate con l’affermazione pronunciata. Al contrario, combinare il recupero di informazioni con un ragionamento esplicito migliora il confronto tra affermazioni e prove: un LALM ottimizzato per il ragionamento raggiunge un’accuratezza dell’86,1%. VeriSpeak mette in luce che per rilevare efficacemente la disinformazione nel parlato non basta comprendere il parlato: servono anche ragionamenti fondati sulle prove recuperate. Il dataset è disponibile pubblicamente su Hugging Face all’indirizzo https://huggingface.co/datasets/abhiram4572/VeriSpeak.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv