Vai al contenuto
AI.info

Ricerca

WorldReward: modellazione delle ricompense per modelli del mondo condizionati dalla telecamera

I modelli del mondo condizionati dalla telecamera generano video interattivi in cui le azioni impartite dovrebbero produrre i cambiamenti attesi nella scena, mentre l’aspetto, la geometria e le dinami

WorldReward: modellazione delle ricompense per modelli del mondo condizionati dalla telecamera
arXiv
2609.03952
Pubblicato
2026-09-03
Autori
Yibin Wang, Zehan Wang, Junshu Tang, Zhimin Li, Yujie Zhou, Jiazi Bu, Pengyang Ling, Feng Han, Zhixiong Zhang, Long Xing, Shengyuan Ding, Ziang Li, Cheng Jin, Yuhang Zang, Jiaqi Wang, Tianyu Pang

Abstract degli autori

I modelli del mondo condizionati dalla telecamera generano video interattivi in cui le azioni impartite dovrebbero produrre i cambiamenti attesi nella scena, mentre l’aspetto, la geometria e le dinamiche temporali restano coerenti. Le ricompense esistenti valutano questi requisiti separatamente: quelle basate sulla geometria stimano l’esecuzione delle traiettorie, ma non possono giudicare la qualità visiva del movimento eseguito; quelle basate sulle immagini misurano la qualità dei fotogrammi senza cogliere l’esecuzione delle azioni né le dinamiche temporali. Ipotizziamo che un modello visione-linguaggio (VLM) offra uno spazio di ragionamento comune per mettere in relazione le azioni con i loro esiti visivi. Tuttavia, valutare un intero video lungo rispetto alla sua sequenza completa di azioni crea un contesto esteso e ricco di elementi di disturbo, nel quale le prove visive di azioni locali di breve durata possono sfuggire o perdere rilievo. Presentiamo WorldReward, un modello di ricompensa basato su VLM e sulle preferenze a coppie che unifica la valutazione della coerenza con le azioni e della qualità visiva per i modelli del mondo condizionati dalla telecamera. WorldReward suddivide le coppie di video in segmenti allineati alle azioni, organizza ciascun segmento in prove visive strutturate e aggrega tramite votazione le decisioni sui singoli segmenti in preferenze distinte, a livello di video, relative alle azioni e alla qualità visiva. Per addestrarlo, costruiamo un dataset di preferenze su larga scala arricchito con ragionamenti, usando giudizi strutturati generati da un VLM di frontiera e affinati tramite verifiche condotte da agenti con strumenti e revisioni umane mirate. Introduciamo inoltre WorldReward-Bench, un benchmark annotato da esseri umani che misura la concordanza tra il modello di ricompensa e le preferenze umane per la coerenza con le azioni, la qualità dell’aspetto e la qualità del movimento. WorldReward raggiunge la concordanza più alta in tutte e tre le dimensioni, superando GPT-5.5 rispettivamente di 3,42, 1,45 e 3,56 punti percentuali. Utilizzato nel post-addestramento con RL di HY-WorldPlay 1.5, migliora sistematicamente sia l’esecuzione delle azioni sia la qualità visiva su orizzonti temporali dal breve al lungo termine.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv