Vai al contenuto
AI.info

Ricerca

ModaLens: misurare la sensibilità alle immagini nei modelli visivo-linguistici medici condizionati dal referto

Un referto radiologico può già rispondere a una domanda clinica, perciò è difficile capire se un modello visivo-linguistico utilizzi anche l’immagine. ModaLens, una verifica basata sulla sostituzione

ModaLens: misurare la sensibilità alle immagini nei modelli visivo-linguistici medici condizionati dal referto
arXiv
2609.15635
Pubblicato
2026-09-14
Autori
Sebastián Andrés Cajas Ordóñez, Maximin Lange, Quang Bui, Anqi Peter Li, Felipe Ocampo Osorio, Rafi Al Attrach, Kushul Reddy Palakala, Sahil Kapadia, Zakaria Laouabdia Sellami, Xinyue Zhang, Ashley Zhang, Leo Anthony Celi

Abstract degli autori

Un referto radiologico può già rispondere a una domanda clinica, perciò è difficile capire se un modello visivo-linguistico utilizzi anche l’immagine. ModaLens, una verifica basata sulla sostituzione appaiata delle immagini, misura come la disponibilità del referto cambi la sensibilità alle immagini: MedGemma-27B viene valutato su 3.199 casi appaiati MIMIC-CXR relativi a 293 pazienti, con tutte le 14 domande per ciascun caso (13 su reperti specifici e una composita). Ogni immagine viene sostituita con una proveniente da un altro esame, di solito dello stesso paziente, mantenendo invariati la domanda e il referto. Con un’istruzione esplicita a rispondere, la risposta generata dal modello cambia nel 4,26% delle prove in presenza del referto e nel 20,94% in sua assenza: un aumento appaiato di 16,7 punti (intervallo di confidenza al 95% con clustering per paziente: da 15,6 a 17,7). In questo protocollo, dunque, la disponibilità del referto riduce la sensibilità alla sostituzione dell’immagine. Il prompt originale, con lettura del primo token in minuscolo, dà il 4,70% contro il 17,07%; le sostituzioni modificano anche i punteggi continui delle risposte quando la previsione binaria non cambia. Le etichette sono ricavate dai referti, il che limita le conclusioni sulla correttezza dell’interpretazione visiva; la stessa tendenza si riscontra in altre due famiglie di modelli. Il codice, i prompt esatti e una registrazione dell’esecuzione per ogni dato numerico sono disponibili su https://github.com/criticaldata/MODALENS.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv