Vai al contenuto
AI.info

Ricerca

HappyWorld-Bench

Valutare i modelli del mondo richiede di misurare sia la qualità dei mondi che generano, sia la loro coerenza e reattività durante l’esplorazione, l’interazione e la modifica. Presentiamo HappyWorld-B

HappyWorld-Bench
arXiv
2609.24308
Pubblicato
2026-09-21
Autori
Zhiqi Bai, Junai Cai, Yixin Chen, Jingrun Du, Tao Feng, Wei Gong, Siyuan Huang, Xiao Lin, Jiaheng Liu, Jun Luo, Yongzhe Lyu, Liya Ma, Zenan Meng, Lin Qu, Wenbo Su, Jiaming Wang, Qinghe Wang, Shaofei Wang, Yanghai Wang, Zequn Wang, Ziming Wang, Hu Wei, Jiangtao Wu, Ruiqi Wu, Jiaxin Xie, Yuchi Xu, Ze Xu, Chengting Yu, Liangyu Yuan, Gang Zeng, Yawen Zeng, Xingyao Zhang, Zizheng Zhang, Bo Zheng, Jiancheng Zhu, Song-Chun Zhu

Abstract degli autori

Valutare i modelli del mondo richiede di misurare sia la qualità dei mondi che generano, sia la loro coerenza e reattività durante l’esplorazione, l’interazione e la modifica. Presentiamo HappyWorld-Bench, un benchmark completo che valuta se i mondi generati restano affidabili mentre gli agenti interagiscono con essi. Il nostro approccio si basa su un quadro gerarchico di sei capacità dei mondi (W1-W6), dalla costruzione generativa alla modellazione unificata del mondo, declinato in tre filoni di valutazione indipendenti: modelli video del mondo, modelli spaziali del mondo e modelli del mondo per sistemi embodied. HappyWorld-Bench comprende 1.138 prompt video, 300 scene spaziali e 254 casi di test embodied. In tutti e tre i filoni, abbiamo sviluppato e gestiamo HappyWorld-Arena per organizzare confronti A/B con valutatori umani e ricavare punteggi Elo a livello di modello, che integrano metriche automatizzate di nuova progettazione capaci di misurare la correttezza comportamentale. Valutiamo 14 modelli video del mondo, 9 sistemi spaziali e 8 candidati embodied secondo questo quadro unificato. I risultati rivelano lacune ancora presenti in tutti e tre i filoni: i modelli video mostrano una coerenza ridotta durante sequenze prolungate e successive visite; i modelli spaziali raggiungono al massimo un’accuratezza di posizionamento del 70,14% e un’esecuzione delle modifiche del 73,33%; i modelli embodied faticano a preservare lo stato attraverso azioni in più passaggi e a rispondere con precisione a condizioni di azione modificate e a regole fisiche. Questi risultati evidenziano la necessità di valutare i modelli del mondo non solo in base alla qualità visiva, ma anche alla coerenza dello stato e alla correttezza delle risposte alle azioni e agli interventi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv