Vai al contenuto
AI.info

Ricerca

RewardVerse: ottimizzazione delle policy guidata da rubriche per la modellazione delle ricompense video

L’apprendimento per rinforzo (RL) è fondamentale per ottimizzare i modelli di generazione video, e un modello di ricompensa (RM) robusto ne costituisce il fondamento. Tuttavia, gli attuali modelli di

RewardVerse: ottimizzazione delle policy guidata da rubriche per la modellazione delle ricompense video
arXiv
2609.22947
Pubblicato
2026-09-19
Autori
Zhenchen Tang, Yang Li, Songlin Yang, Bo Peng, Xiaotong Zhao, Shuai Li, Haotian Fan, Alan Zhao, Jing Dong

Abstract degli autori

L’apprendimento per rinforzo (RL) è fondamentale per ottimizzare i modelli di generazione video, e un modello di ricompensa (RM) robusto ne costituisce il fondamento. Tuttavia, gli attuali modelli di ricompensa video producono spesso punteggi scalari instabili, perché associano direttamente la qualità complessa e soggettiva dei video a un singolo punteggio, senza criteri di valutazione espliciti. Questo provoca una deriva dei punteggi scalari, per cui la scala di valutazione collassa o si sposta al variare dei prompt, rendendo inaffidabile la ricompensa per l’RL. Traendo ispirazione dalle pratiche professionali di ingegneria dell’annotazione umana, affrontiamo il problema con RewardVerse, un framework per la valutazione delle ricompense video basato su rubriche, che introduce una rubrica dinamica come rappresentazione intermedia tra la richiesta di valutazione e il valutatore. Invece di assegnare direttamente punteggi senza vincoli, RewardVerse genera prima criteri di valutazione espliciti e poi assegna i punteggi sulla base della rubrica, offrendo un riferimento semantico stabile che attenua la deriva dei punteggi scalari. Per ottimizzare in modo efficiente questa pipeline collaborativa, proponiamo Rubric-Guided Policy Optimization (RGPO), un algoritmo di addestramento in due fasi. RGPO avvia il valutatore usando rubriche iniziali in evoluzione autonoma, quindi ottimizza congiuntamente il generatore di rubriche, affinché produca criteri di valutazione adattati alla richiesta, allineando al contempo e continuamente il valutatore alle valutazioni umane. Esperimenti approfonditi sul benchmark EvalVerse, composto da 16 dimensioni, e su set di dati esterni dimostrano che RewardVerse attenua la deriva dei punteggi scalari, raggiunge prestazioni allo stato dell’arte sia nella valutazione puntuale sia in quella a coppie e fornisce un segnale di ricompensa robusto e interpretabile per l’RL nella generazione video.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv