Ricerca
DEPICT: valutare l’allineamento tra testo e immagini attraverso la concordanza delle risposte
L’allineamento tra immagini e testo è un problema centrale della visione artificiale, con applicazioni nella valutazione delle didascalie, nel rilevamento delle allucinazioni, nella selezione dei dati

- arXiv
- 2610.03617
- Pubblicato
- 2026-10-02
- Autori
- Vasco Ramos, Sandra Godinho Silva, Joao Magalhaes, Ricardo Rei, Pedro Henrique Martins
Abstract degli autori
L’allineamento tra immagini e testo è un problema centrale della visione artificiale, con applicazioni nella valutazione delle didascalie, nel rilevamento delle allucinazioni, nella selezione dei dati e nella valutazione comparativa dei generatori da testo a immagine (T2I). Con il miglioramento dei modelli T2I, la valutazione comparativa è diventata più impegnativa e richiede metriche capaci di individuare problemi come oggetti mancanti, attributi scambiati, errori di conteggio e negazioni ignorate. I lavori recenti affrontano il problema sottoponendo i valutatori a fine-tuning su dati di preferenza oppure interrogando un modello visivo-linguistico con la didascalia nel suo complesso o con domande di verifica scomposte. Gli approcci esistenti, però, presentano dei limiti: le metriche sottoposte a fine-tuning restano legate a un solo backbone e alla distribuzione dei dati di addestramento; le metriche olistiche trascurano i dettagli più minuti; e quelle basate sulla scomposizione presuppongono che la risposta corretta sia sempre SÌ, penalizzando le immagini fedeli alla didascalia quando tale presupposto non vale. Proponiamo invece DEPICT, una metrica che non richiede addestramento e sostituisce le risposte di riferimento fisse con la concordanza attesa tra le risposte basate sull’immagine e quelle basate sulla sola didascalia, ponderando le domande in base a quanto la didascalia ne determini la risposta. Sostituendo i riferimenti fissi, la nostra regola di concordanza porta l’accuratezza sulle negazioni dal 19% all’88%. Per recuperare il contesto perso durante la scomposizione, DEPICT combina questo punteggio di concordanza con un punteggio olistico. Valutiamo DEPICT su cinque benchmark e undici backbone appartenenti a tre famiglie di modelli e riscontriamo che supera tutte le metriche che non richiedono addestramento e ottiene risultati migliori dei valutatori sottoposti a fine-tuning in due dei tre benchmark di correlazione con i giudizi umani.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv