Vai al contenuto
AI.info

Ricerca

VIEScore2: valutazione unificata delle immagini con spiegazioni ancorate spazialmente

I valutatori di immagini sintetiche esistenti forniscono in genere solo un punteggio numerico di qualità, senza individuare le regioni dell’immagine che lo giustificano. Presentiamo VIEScore2, un valu

VIEScore2: valutazione unificata delle immagini con spiegazioni ancorate spazialmente
arXiv
2610.00994
Pubblicato
2026-10-01
Autori
Xianda Du, Max Ku, Weiming Ren, Zhi Rui Tam, Chunlin Ren, Ping Nie, Min-Hung Chen, Wenhu Chen

Abstract degli autori

I valutatori di immagini sintetiche esistenti forniscono in genere solo un punteggio numerico di qualità, senza individuare le regioni dell’immagine che lo giustificano. Presentiamo VIEScore2, un valutatore unificato per la generazione e la modifica di immagini, che può utilizzare immagini di condizionamento. VIEScore2 rappresenta un’immagine come una griglia N x N e predice congiuntamente i punteggi di qualità e la posizione dei difetti in un’unica esecuzione del modello. La sua rappresentazione della griglia in formato testuale offre un’interfaccia comune per diversi tipi di supervisione spaziale e consente di definire obiettivi di post-training direttamente verificabili. Addestriamo il modello su 38K esempi che comprendono, per attività di generazione e modifica, supervisione basata sui soli punteggi, sulla sola localizzazione o su entrambe. Dopo il fine-tuning supervisionato, applichiamo inoltre GRPO per migliorare la localizzazione dei difetti, usando ricompense che combinano la sovrapposizione Dice a livello di cella, l’accuratezza del punteggio e la validità del formato dell’output. Un parser senza parametri trasforma le predizioni strutturate in spiegazioni leggibili. Sulla suite principale, VIEScore2 raggiunge un SRCC di 0,601 per il punteggio complessivo, rispetto a 0,491 di Gemini-3-Flash, il più forte modello di riferimento tra i VLM generalisti zero-shot a parità di input. Nella localizzazione dei difetti, VIEScore2 supera sia i VLM generalisti sia i valutatori spaziali specializzati su tre dei sei benchmark in termini di IoU della griglia per immagine e si colloca tra i primi tre su cinque, compresi dataset diversi da quelli usati per l’addestramento.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv