Ricerca
OmniConfess: far emergere confessioni a livello di token per mitigare le allucinazioni omnimodali
I grandi modelli linguistici omnimodali (OmniLLMs) integrano testo, immagini, audio e video, ma producono allucinazioni quando la generazione si basa sulle evidenze sbagliate. I metodi esistenti appli

- arXiv
- 2610.02999
- Pubblicato
- 2026-10-02
- Autori
- Huiqiang Rong, Haoran Luo, Hui Feng, Zhonghong Ou, Kaiwen Xue, Guoxin Zhang, Yifan Zhu
Abstract degli autori
I grandi modelli linguistici omnimodali (OmniLLMs) integrano testo, immagini, audio e video, ma producono allucinazioni quando la generazione si basa sulle evidenze sbagliate. I metodi esistenti applicati durante l’inferenza possono ridurre le allucinazioni, ma raramente rivelano quali evidenze sostengano un’affermazione generata. Presentiamo OmniConfess, un metodo senza addestramento per mitigare le allucinazioni omnimodali. Il metodo fissa una risposta candidata e ne ricalcola il punteggio a livello di token sottoponendo le evidenze di ciascun canale a interventi controllati. Produce così una confessione strutturata per token e per canale che rivela da quali evidenze dipende la risposta. OmniConfess usa questa confessione per preservare i contenuti fondati sulle evidenze e correggere le affermazioni basate su evidenze irrilevanti o contraddittorie. Per valutare OmniConfess, abbiamo costruito OmniHalluBench, un benchmark di 3.540 esempi ricavati da sei dataset che coprono contesti testuali, visivi, audio e video, nonché compiti di valutazione e di generazione a forma libera. Gli esperimenti mostrano che OmniConfess mitiga le allucinazioni in contesti eterogenei per modalità e compiti. Il nostro codice e il benchmark sono disponibili pubblicamente all’indirizzo https://github.com/RongHuiQiang/OmniConfess.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv