Ricerca
Tri-PvP: mettere in luce il bias di modalità nei modelli linguistici di grandi dimensioni omni-modali attraverso conflitti tra evidenze percettive e proposizionali
I modelli linguistici di grandi dimensioni omni-modali (OLLM) elaborano congiuntamente visione, audio e testo, ma il loro bias di modalità in presenza di conflitti tra modalità diverse è ancora poco s

- arXiv
- 2609.06011
- Pubblicato
- 2026-09-05
- Autori
- Yen-Ting Piao, Shu-Yun Chen, Chin-Hui Chu, Chun-Wei Chen, Shih-Yun Shan Kuan, Hung-yi Lee, Yun-Nung Chen
Abstract degli autori
I modelli linguistici di grandi dimensioni omni-modali (OLLM) elaborano congiuntamente visione, audio e testo, ma il loro bias di modalità in presenza di conflitti tra modalità diverse è ancora poco studiato. I benchmark esistenti confondono due forme distinte di evidenza all’interno di una singola modalità: i segnali percettivi (per esempio, una fotografia o una registrazione di un cane) e quelli proposizionali (per esempio, l’affermazione dichiarativa «questo è un cane»). Di conseguenza, qualsiasi bias di modalità misurato risulta inevitabilmente confuso con il bias legato alla forma dell’evidenza, impedendo di attribuirlo con chiarezza all’una o all’altra fonte. Per affrontare questo problema, presentiamo Tri-PvP, un benchmark di conflitti tri-modale composto da 8.000 campioni, che combina visione, audio e testo e in cui visione e audio assumono ciascuno una forma percettiva o proposizionale. Dalla valutazione di cinque OLLM emerge un robusto bias visivo nella maggior parte dei modelli e delle condizioni relative al tipo di evidenza. È cruciale che rileviamo un’asimmetria sistematica nel bias legato alla forma dell’evidenza: i modelli mostrano un bias più marcato verso i segnali percettivi nella visione, ma verso quelli proposizionali nell’audio. Ulteriori analisi con probing lineare strato per strato e decoding contrastivo rivelano che il bias di modalità è già decodificabile linearmente nei primi strati di rappresentazione e può essere mitigato solo in parte, evidenziando la necessità di strategie di mitigazione che vadano oltre gli interventi superficiali.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv