Ricerca
UFO: catena di valutazione per l’allineamento a tutte le condizioni nella generazione multimodale di immagini
La generazione multimodale di immagini, in particolare la personalizzazione basata sul soggetto, ha attirato un’attenzione crescente negli ultimi anni. Nonostante i rapidi progressi dei modelli genera

- arXiv
- 2609.12397
- Pubblicato
- 2026-09-14
- Autori
- Danning Zhang, Yijing Lin, Shuhan Zhuang, Mengqi Huang, Shaojin Wu, Shancheng Fang, Zhendong Mao
Abstract degli autori
La generazione multimodale di immagini, in particolare la personalizzazione basata sul soggetto, ha attirato un’attenzione crescente negli ultimi anni. Nonostante i rapidi progressi dei modelli generativi, la loro valutazione resta ampiamente indietro. I metodi esistenti, basati sugli embedding o sui modelli linguistici multimodali di grandi dimensioni (MLLM), valutano l’allineamento a ciascuna condizione modale separatamente. Questo contraddice l’obiettivo della generazione multimodale di immagini, che richiede l’allineamento simultaneo alle condizioni, e produce risultati poco coerenti con i giudizi umani. Per affrontare questa sfida proponiamo UFO, il primo quadro unificato per valutare simultaneamente l’allineamento a tutte le condizioni. Nello specifico, UFO introduce un nuovo paradigma, Atomized Chain-of-Evaluation, \emph{i.e.}, che dapprima scompone l’allineamento a tutte le condizioni in una sequenza di unità atomiche di valutazione (AEU) dettagliate e disgiunte, le suddivide in classi distinte in base alla modalità pertinente e impiega poi chiamate a funzioni generiche o dedicate per verificare accuratamente i diversi tipi di AEU. I risultati sperimentali mostrano che UFO raggiunge la correlazione più alta con le preferenze espresse nelle valutazioni umane, con un miglioramento medio del 15,25\%. Presentiamo inoltre UFO-Bench, un benchmark dedicato a valutare in modo complessivo le prestazioni dei modelli di personalizzazione esistenti in presenza delle diverse interazioni reciproche tra condizioni testuali e visive.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv