Vai al contenuto
AI.info

Ricerca

I diavoli nello snodo della domanda: orientamento dello snodo condizionato dalla fonte per mitigare le allucinazioni nei modelli linguistici audiovisivi di grandi dimensioni

I modelli linguistici audiovisivi di grandi dimensioni (AVLLM) hanno compiuto notevoli progressi nella comprensione e nel ragionamento multimodali grazie alle interazioni tra informazioni visive, udit

I diavoli nello snodo della domanda: orientamento dello snodo condizionato dalla fonte per mitigare le allucinazioni nei modelli linguistici audiovisivi di grandi dimensioni
arXiv
2609.37568
Pubblicato
2026-09-29
Autori
Yu Zhang, Pingrui Zhang, Xuefeng Bai, Pengfei Zhang, Yang Xiang, Kehai Chen

Abstract degli autori

I modelli linguistici audiovisivi di grandi dimensioni (AVLLM) hanno compiuto notevoli progressi nella comprensione e nel ragionamento multimodali grazie alle interazioni tra informazioni visive, uditive e linguistiche. Tuttavia, studi recenti mostrano che gli AVLLM devono affrontare una sfida cruciale: la $\textbf{source-confused grounding hallucination}$, in cui segnali provenienti dalla modalità non utilizzata inducono risposte che la modalità richiesta non supporta, compromettendo l’affidabilità nelle applicazioni reali. I metodi esistenti hanno fatto progressi nel mitigare questo problema, ma il modo in cui esso nasce dalle interazioni interne tra modalità resta poco chiaro. Per colmare questa lacuna, conduciamo analisi degli interventi sui percorsi e delle rappresentazioni, che rivelano un meccanismo di $\textbf{question-relay}$: gli stati della domanda trasportano segnali interferenti insieme alle evidenze della fonte richiesta, indebolendo l’ancoraggio alle evidenze della modalità richiesta. Interrompere i percorsi dalla modalità interferente agli stati della domanda produce un recupero del logit della risposta corretta maggiore rispetto all’interruzione dei percorsi verso la posizione di generazione. Sulla base di questi risultati, proponiamo $\textbf{SECRET}$ ($\textbf{S}$ourc$\textbf{E}$-$\textbf{C}$onditioned $\textbf{RE}$lay s$\textbf{T}$eering), un metodo che non richiede addestramento e mitiga l’interferenza tra modalità nello snodo della domanda. Utilizzando rappresentazioni contrastanti della domanda ottenute mediante diversi interventi sui percorsi delle modalità, SECRET orienta gli stati originali della domanda verso le evidenze della fonte richiesta. Esperimenti condotti su due benchmark ampiamente adottati, CMM e AVHBench, con tre AVLLM mostrano che SECRET supera sistematicamente i precedenti metodi che non richiedono addestramento, mitigando in misura sostanziale le allucinazioni dovute alla confusione tra le fonti (per esempio, fino a +18,0 e +7,1 punti percentuali rispetto ai modelli di base). La generazione di didascalie specifiche per modalità ne dimostra inoltre la generalizzabilità alla generazione aperta.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv