Ricerca
Gli MLLM allucinano quando la distribuzione dell’informazione devia nelle teste sinergiche
I grandi modelli linguistici multimodali (MLLM) spesso faticano a evitare le allucinazioni, ostacolando così le loro applicazioni pratiche affidabili. I metodi di mitigazione esistenti basati sull’att

- arXiv
- 2609.09206
- Pubblicato
- 2026-09-05
- Autori
- Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han
Abstract degli autori
I grandi modelli linguistici multimodali (MLLM) spesso faticano a evitare le allucinazioni, ostacolando così le loro applicazioni pratiche affidabili. I metodi di mitigazione esistenti basati sull’attenzione si affidano principalmente a segnali indiretti (per esempio, i pesi di attenzione), che non riescono a riflettere con precisione l’effettivo spostamento dell’informazione alla base della generazione di allucinazioni. In questo articolo proponiamo HEAL, un metodo per disaccoppiare e calibrare l’informazione a livello di testa, volto a identificare e mitigare le allucinazioni. HEAL applica innanzitutto un intervento causale sul rumore agli output delle teste di attenzione, così da escludere quelle causalmente ridondanti. In seguito, disaccoppia la distribuzione dell’informazione nelle teste rimanenti mediante il metodo controfattuale delle differenze nelle differenze, classificandole in quattro tipi. Dalla nostra analisi emerge che le allucinazioni si verificano quando la distribuzione dell’informazione nelle teste sinergiche si discosta da un equilibrio sano e non sono fortemente correlate alla quantità o alla forza delle teste specifiche di una modalità. Sulla base di questa osservazione, HEAL inserisce fattori dinamici di calibrazione dell’informazione nei vettori dei valori delle teste sinergiche e regola attivamente le dipendenze tra visione e linguaggio, orientando la distribuzione dell’output verso evidenze fattuali. Esperimenti approfonditi dimostrano che HEAL riduce efficacemente le allucinazioni in diversi MLLM, offrendo un approccio semplice e interpretabile per aumentare l’affidabilità dei modelli.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv