Ricerca
L’illusione dell’allineamento nei grandi modelli linguistici multimodali
La similarità visivo-testuale, misurata strato per strato nei grandi modelli linguistici multimodali (MLLMs), viene ampiamente interpretata come prova del fatto che il modello linguistico integri prog

- arXiv
- 2609.30210
- Pubblicato
- 2026-09-24
- Autori
- Hong-Han Wang, Yuntao Wang, Hu Ding
Abstract degli autori
La similarità visivo-testuale, misurata strato per strato nei grandi modelli linguistici multimodali (MLLMs), viene ampiamente interpretata come prova del fatto che il modello linguistico integri progressivamente i contenuti visivi in uno spazio di rappresentazione condiviso. Questa interpretazione si basa sull’assunto che i punteggi scalari di allineamento riflettano un’interazione multimodale a livello dei contenuti. Per verificare questo assunto, interveniamo in modo controllato sul flusso visivo. Su 13 MLLM di cinque famiglie, con un numero di parametri compreso tra 0,5 e 72 miliardi, la sostituzione dei token visivi in uscita dal proiettore con rumore gaussiano riduce nettamente l’accuratezza nei compiti; eppure, quattro misure scalari standard (CKA, SVCCA, MIR e il coseno del primo angolo principale) non riescono a distinguere in modo coerente il flusso alterato da quello originale. Chiamiamo questo fenomeno illusione dell’allineamento e ne riconduciamo l’origine al percorso condiviso del modello linguistico: le proiezioni di riduzione dimensionale anisotrope delle MLP attirano i token visivi e testuali verso direzioni comuni nello spazio di uscita, producendo un allineamento indotto dai pesi. Poiché questa componente è essenzialmente unidimensionale, introduciamo il divario tra gli angoli principali (PA gap), definito come la differenza tra i coseni dei due angoli principali più piccoli, che consente di distinguere la similarità indotta dai pesi dalla struttura visiva multidirezionale. In presenza di livelli crescenti di alterazione visiva, il PA gap segue l’accuratezza nei compiti in modo più coerente dei punteggi scalari considerati; in presenza di un’immagine strutturata ma irrilevante, mette inoltre in luce situazioni in cui la geometria interna e l’accuratezza nei compiti divergono. L’allineamento visivo-testuale interno agli MLLM va quindi interpretato soprattutto come uno strumento diagnostico geometrico del flusso visivo all’interno del modello linguistico, non come un indicatore diretto dell’interazione multimodale a livello dei contenuti, ed è più informativo quando viene calibrato con evidenze controllate sui compiti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv