Vai al contenuto
AI.info

Ricerca

Non è ciò che mostra l’immagine: il contesto irrilevante destabilizza i VLM valutatori senza fornire loro informazioni

I modelli visivo-linguistici (VLM) vengono usati sempre più spesso al posto degli annotatori umani: è quindi importante che i test di sostituibilità riflettano il modello, anziché condizioni di valuta

Non è ciò che mostra l’immagine: il contesto irrilevante destabilizza i VLM valutatori senza fornire loro informazioni
arXiv
2609.37863
Pubblicato
2026-09-29
Autori
Nagham Omar, Mahmoud Jabarin, Kinan Ibraheem, Lotem Peled-Cohen

Abstract degli autori

I modelli visivo-linguistici (VLM) vengono usati sempre più spesso al posto degli annotatori umani: è quindi importante che i test di sostituibilità riflettano il modello, anziché condizioni di valutazione accidentali. Presentiamo MIST, il Misleading-Image Stress Test: 200 frasi in inglese, ciascuna costruita attorno a un’espressione interpretabile sia in senso figurato sia in senso letterale e presentata con un’immagine coerente che ne raffigura l’interpretazione, un’immagine fuorviante che raffigura quella opposta oppure senza alcuna immagine. Le istruzioni richiedono di assegnare l’etichetta basandosi soltanto sulla frase, quindi nessuna immagine dovrebbe cambiare una risposta. Ci aspettavamo che ciascuna immagine orientasse le etichette assegnate da un valutatore verso il significato che raffigura, ma non è successo con nessuno dei due tipi di immagine. Su tredici VLM valutatori, un’immagine coerente ha cambiato il 20,5% delle etichette e una fuorviante il 19,4%: percentuali simili per ogni valutatore ed entrambe superiori all’11,6% ottenuto eliminando l’istruzione di ignorare l’immagine, pur lasciandola presente. Eppure, solo il 37% delle etichette che differiscono tra le due immagini si è spostato verso il significato raffigurato, e la concordanza con i nostri annotatori umani resta invariata sia in assenza di immagine sia con un’immagine coerente o fuorviante. L’effetto è minore nei sette valutatori che superano l’alt-test rispetto ai sei che non lo superano mai, ma è presente in tutti: a far cambiare risposta a un valutatore è la presenza di un’immagine, non quale delle due sia. Un giudizio di sostituibilità descrive quindi una configurazione tanto quanto un modello.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv