Vai al contenuto
AI.info

Ricerca

Oltre la somiglianza visiva: recupero allineato alle entità per la risposta a domande visive basata sulla conoscenza

La risposta a domande visive basata sulla conoscenza (KB-VQA) si affida al recupero di informazioni esterne per rispondere a domande che riguardano entità della coda lunga. Tuttavia, le pipeline di re

Oltre la somiglianza visiva: recupero allineato alle entità per la risposta a domande visive basata sulla conoscenza
arXiv
2608.21450
Pubblicato
2026-08-19
Autori
Hangrui Xu, Zhengxian Wu, Yunyao Yu, Zhuohong Chen, Rui Cong, Xiangwen Deng, Zhifang Liu, Peng Jiao, Haoqian Wang

Abstract degli autori

La risposta a domande visive basata sulla conoscenza (KB-VQA) si affida al recupero di informazioni esterne per rispondere a domande che riguardano entità della coda lunga. Tuttavia, le pipeline di recupero esistenti impiegano prevalentemente encoder duali in stile CLIP, che privilegiano la somiglianza visiva superficiale rispetto all’allineamento semantico a livello di entità. Questo approccio spesso fallisce quando concetti semanticamente identici presentano marcate variazioni visive o quando entità distinte appaiono visivamente simili. Per affrontare il problema, proponiamo KBMR, il primo sistema di recupero tramite embedding basato su MLLM e progettato per la KB-VQA. Sfruttando le solide capacità autoregressive degli MLLM, KBMR mappa le immagini in uno spazio semantico che preserva meglio l’identità dei concetti. Per affrontare la sfida della supervisione rumorosa nel recupero su scala Wikipedia, introduciamo un discriminatore semantico basato su MLLM che genera pesi continui di coerenza dell’entità. Questi pesi guidano una nuova funzione obiettivo di distillazione semantica continua, rendendo possibili un efficace campionamento di esempi negativi difficili e una supervisione soft che va oltre le rigide etichette binarie. Esperimenti approfonditi dimostrano che KBMR supera nettamente le baseline CLIP, con un miglioramento fino al 14,7% della Recall@1 nel recupero e un aumento del 9,4% dell’accuratezza della VQA end-to-end. Il codice è disponibile all’indirizzo https://github.com/realHarryX/KBMR.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv