Vai al contenuto
AI.info

Ricerca

Apprendere embedding multimodali con una lettura allineata alle evidenze

I modelli linguistici multimodali di grandi dimensioni possono rendere accessibili, attraverso la generazione, evidenze rilevanti per un compito, ma produrre evidenze utili non determina di per sé com

Apprendere embedding multimodali con una lettura allineata alle evidenze
arXiv
2609.33659
Pubblicato
2026-09-27
Autori
Zirong Chen, Fuda Ye, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Haijin Liang, Jin Ma, Jiachuan Wang, Yongqi Zhang

Abstract degli autori

I modelli linguistici multimodali di grandi dimensioni possono rendere accessibili, attraverso la generazione, evidenze rilevanti per un compito, ma produrre evidenze utili non determina di per sé come queste entrino in un embedding per il retrieval. Studiamo se l’organizzazione semantica di tali evidenze possa anche stabilire dove leggere le rappresentazioni. Per rispondere a questa domanda, introduciamo EviAlign, che combina la generazione semantica delle evidenze con la lettura ai confini delle unità in un modello linguistico multimodale di grandi dimensioni condiviso. EviAlign organizza le evidenze in cinque unità semantiche, legge lo stato contestualizzato al confine di ciascuna unità e aggrega questi stati in un unico embedding normalizzato. Gli obiettivi di generazione e di retrieval contrastivo addestrano congiuntamente questa struttura condivisa. Con la stessa lettura in coda, le evidenze organizzate semanticamente e una CoT in forma libera ottengono prestazioni di retrieval quasi identiche: l’organizzazione delle evidenze, da sola, non spiega quindi l’intero miglioramento. Uno studio controllato $2\times3$ confronta un’organizzazione coerente delle evidenze con una permutata, applicando tre strategie di lettura e usando bersagli di addestramento con segmenti di evidenza corrispondenti. Con cinque stati di lettura e lo stesso pooling medio, il vantaggio dell’organizzazione semantica coerente cresce da 0,65 punti nelle posizioni di addestramento basate sulla lunghezza a 2,39 punti ai confini delle evidenze, producendo un’interazione di co-progettazione di 1,74 punti. Su 12 compiti di retrieval MMEB, EviAlign raggiunge un Recall@1 medio di 76,9 con 500K coppie di addestramento, mantenendo indicizzazione e attribuzione dei punteggi basate su un singolo vettore.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv