Vai al contenuto
AI.info

Ricerca

Caos nel testo: la preferenza per una modalità nei retriever a modalità miste

I retriever densi hanno compiuto notevoli progressi con i corpora di testi e immagini, ma non è ancora chiaro se queste capacità si estendano in modo affidabile ai corpora misti, che contengono docume

Caos nel testo: la preferenza per una modalità nei retriever a modalità miste
arXiv
2610.11816
Pubblicato
2026-10-08
Autori
Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Zhipeng Xu, Sen Mei, Linlin Xin, Zheni Zeng, Maosong Sun

Abstract degli autori

I retriever densi hanno compiuto notevoli progressi con i corpora di testi e immagini, ma non è ancora chiaro se queste capacità si estendano in modo affidabile ai corpora misti, che contengono documenti testuali, documenti costituiti da immagini e documenti che fondono testo e immagini. In questo articolo esaminiamo sistematicamente retriever basati su diverse architetture e scopriamo che le loro prestazioni sono molto sensibili alla composizione per modalità. Man mano che i documenti costituiti da immagini vengono sostituiti con rappresentazioni testuali semanticamente corrispondenti, le prestazioni del recupero seguono una marcata curva a V: restano elevate nei corpora monomodali, ma peggiorano notevolmente quando le modalità coesistono. In particolare, il testo non pertinente provoca un peggioramento più grave rispetto a un numero uguale di immagini non pertinenti, un fenomeno che chiamiamo Chaos in the Text. Un’ulteriore analisi rivela una preferenza per una modalità: alle rappresentazioni testuali vengono sistematicamente assegnati punteggi di somiglianza più alti, consentendo al testo non pertinente di superare in classifica immagini pertinenti. Per attenuare questa distorsione, introduciamo Trident, che costruisce per ogni documento una vista testuale, una visiva e una che fonde testo e immagini, trattandole come esempi positivi di pari importanza, e ottimizza congiuntamente la discriminazione della pertinenza e l’equilibrio tra le viste positive mediante Multi-Positive View InfoNCE. Esperimenti su benchmark di documenti visivi e immagini naturali mostrano che trident migliora il recupero a modalità miste sia nelle architetture basate su CLIP sia in quelle basate su VLM, riduce la sensibilità alla composizione per modalità e al testo fuorviante e aumenta le prestazioni medie del recupero monomodale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv