Ricerca
SnapBench: un benchmark per la ricerca multimodale «scatta e chiedi» nelle interazioni da dispositivo mobile
L’IA su dispositivi mobili funge da oracolo visivo: permette agli utenti di fotografare qualcosa e chiedere informazioni al riguardo. La ricerca «scatta e chiedi» è ormai uno dei modi più comuni per a

- arXiv
- 2608.29607
- Pubblicato
- 2026-08-30
- Autori
- Zirong Chen, Fuda Ye, Kuan Zhang, Enjun Du, Junfu Pu, Xinlei Wang, Xinyu Zuo, Lisheng Duan, Jin Ma, Yongqi Zhang
Abstract degli autori
L’IA su dispositivi mobili funge da oracolo visivo: permette agli utenti di fotografare qualcosa e chiedere informazioni al riguardo. La ricerca «scatta e chiedi» è ormai uno dei modi più comuni per accedere all’IA su dispositivi mobili, ma le foto sono spesso sfocate e le domande testuali possono essere brevi o contenere errori di battitura. I benchmark esistenti, però, mettono alla prova solo input privi di alterazioni oppure non valutano separatamente la robustezza della coppia foto-domanda nella ricerca «scatta e chiedi». Presentiamo quindi SnapBench, il primo benchmark basato su coppie foto-domanda per valutare la robustezza della ricerca multimodale «scatta e chiedi»: comprende 1.145 query e 9.085 elementi della galleria, sottoposti a 53 condizioni controllate di alterazione e corredati di annotazioni umane. Valutiamo 16 sistemi di ricerca multimodale, tra cui encoder a doppia torre e VLM basati su embedding. I risultati mostrano che le alterazioni delle immagini peggiorano notevolmente la ricerca, mentre quelle del testo incidono soprattutto sulla ricerca basata solo sul testo e hanno un impatto limitato sulla ricerca congiunta. La ricerca basata solo su immagini non alterate spesso supera quella congiunta: ciò indica che il testo poco dettagliato può frenare la ricerca e che, in presenza di input alterati, manca un meccanismo per ripiegare su un’altra modalità. SnapBench offre un ambiente di test controllato per valutare la robustezza della ricerca negli scenari «scatta e chiedi». Proponiamo inoltre MOOR (Modality-anchored, Outlier-aware, Optimal Reweighting), un semplice approccio di fusione adattiva che evidenzia la necessità di calibrare le modalità in base alla loro affidabilità nella ricerca «scatta e chiedi».
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv