Vai al contenuto
AI.info

Ricerca

UFO: catena di valutazione per l’allineamento a tutte le condizioni nella generazione multimodale di immagini

La generazione multimodale di immagini, in particolare la personalizzazione basata sul soggetto, ha attirato un’attenzione crescente negli ultimi anni. Nonostante i rapidi progressi dei modelli genera

UFO: catena di valutazione per l’allineamento a tutte le condizioni nella generazione multimodale di immagini
arXiv
2609.12397
Pubblicato
2026-09-14
Autori
Danning Zhang, Yijing Lin, Shuhan Zhuang, Mengqi Huang, Shaojin Wu, Shancheng Fang, Zhendong Mao

Abstract degli autori

La generazione multimodale di immagini, in particolare la personalizzazione basata sul soggetto, ha attirato un’attenzione crescente negli ultimi anni. Nonostante i rapidi progressi dei modelli generativi, la loro valutazione resta ampiamente indietro. I metodi esistenti, basati sugli embedding o sui modelli linguistici multimodali di grandi dimensioni (MLLM), valutano l’allineamento a ciascuna condizione modale separatamente. Questo contraddice l’obiettivo della generazione multimodale di immagini, che richiede l’allineamento simultaneo alle condizioni, e produce risultati poco coerenti con i giudizi umani. Per affrontare questa sfida proponiamo UFO, il primo quadro unificato per valutare simultaneamente l’allineamento a tutte le condizioni. Nello specifico, UFO introduce un nuovo paradigma, Atomized Chain-of-Evaluation, \emph{i.e.}, che dapprima scompone l’allineamento a tutte le condizioni in una sequenza di unità atomiche di valutazione (AEU) dettagliate e disgiunte, le suddivide in classi distinte in base alla modalità pertinente e impiega poi chiamate a funzioni generiche o dedicate per verificare accuratamente i diversi tipi di AEU. I risultati sperimentali mostrano che UFO raggiunge la correlazione più alta con le preferenze espresse nelle valutazioni umane, con un miglioramento medio del 15,25\%. Presentiamo inoltre UFO-Bench, un benchmark dedicato a valutare in modo complessivo le prestazioni dei modelli di personalizzazione esistenti in presenza delle diverse interazioni reciproche tra condizioni testuali e visive.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv