Vai al contenuto
AI.info

Ricerca

Think Before You Score: Thinking Reward Model per la generazione visiva

I modelli di ricompensa visiva sono essenziali per valutare e migliorare i modelli di generazione visiva. Gli approcci esistenti, però, associano in genere direttamente le condizioni del compito e i r

Think Before You Score: Thinking Reward Model per la generazione visiva
arXiv
2609.37372
Pubblicato
2026-09-29
Autori
Xuehai Bai, Zhenchen Tang, Yang Shi, Dianyi Wang, Tengfei Liu, Wanshun Su, Xuanyu Zhu, Ruohui Wang, Haiwen Diao, Haotian Wang, Xiaoling Gu, Yuanxing Zhang

Abstract degli autori

I modelli di ricompensa visiva sono essenziali per valutare e migliorare i modelli di generazione visiva. Gli approcci esistenti, però, associano in genere direttamente le condizioni del compito e i risultati candidati a ricompense espresse da un singolo valore numerico, lasciando implicito che cosa vada valutato in ciascun caso. Presentiamo Think Before You Score, un approccio che stabilisce esplicitamente che cosa conta in ogni caso prima di giudicare quanto bene si comporti il candidato. Seguendo questo principio, proponiamo il Thinking Reward Model (TRM), che formula criteri di valutazione adattati al caso, valuta i candidati in base a tali criteri e produce ricompense granulari per ciascun candidato. Osserviamo inoltre che l’ottimizzazione convenzionale delle preferenze a coppie può indurre una polarizzazione dei punteggi e introduciamo Pairwise Dual-Group Relative Policy Optimization (PD-GRPO), che sfrutta la supervisione a coppie per migliorare la capacità di distinguere tra le ricompense, preservando al tempo stesso l’attribuzione di punteggi granulari a ciascun candidato. Ampi esperimenti su benchmark per i modelli di ricompensa applicati alla generazione e alla modifica di immagini mostrano che TRM raggiunge prestazioni all’avanguardia tra i modelli di ricompensa open source, restando altamente competitivo rispetto alle alternative proprietarie. Inoltre, l’uso di TRM come fonte di ricompensa nell’apprendimento per rinforzo migliora sistematicamente diversi modelli di generazione visiva, dimostrando che le sue ricompense granulari e adattate al caso si traducono in segnali efficaci per ottimizzare la generazione visiva.

Leggi il paper originale su arXiv