Vai al contenuto
AI.info

Ricerca

Lo sviluppo agentico di videogiochi come motore di dati di traiettorie verificabili per ampliare la scala dei modelli del mondo

Una strategia comune per ampliare la scala dei modelli del mondo consiste nell’addestrarli su una maggiore quantità di video raccolti tramite crawling, impiegando più risorse di calcolo. Sosteniamo ch

Lo sviluppo agentico di videogiochi come motore di dati di traiettorie verificabili per ampliare la scala dei modelli del mondo
arXiv
2608.25518
Pubblicato
2026-08-26
Autori
Pengfei Zhou, Hexin Wang, Zhengfeiyang Zhang, Yixing Ma, Zhenglin Wan, Kaipeng Zhang, Wangbo Zhao, Yang You

Abstract degli autori

Una strategia comune per ampliare la scala dei modelli del mondo consiste nell’addestrarli su una maggiore quantità di video raccolti tramite crawling, impiegando più risorse di calcolo. Sosteniamo che questa strategia sia inefficiente: per ampliare la scala dei modelli del mondo serve anche un motore ricorsivo di dati che fornisca segnali di ricompensa fondati su verifiche concrete. Il successo degli agenti di programmazione mostra perché questo aspetto è importante. Poiché il codice è eseguibile, i compilatori e gli ambienti di esecuzione possono fornire ricompense di alta qualità per il post-addestramento dei LLM mediante apprendimento per rinforzo (RL). La generazione spaziale, invece, si affida ancora in larga misura a misure indirette imprecise, come i punteggi CLIP. Questi segnali sono imprecisi e distorti, perciò è difficile usarli a sostegno del post-addestramento mediante RL. Rispetto a queste misure, lo sviluppo di videogiochi offre ai modelli spaziali del mondo l’ambiente di ricompensa che manca loro. Una scena codificata da un motore di gioco è una specifica eseguibile di un mondo: il motore può verificare in modo efficiente collisioni, fisica, navigabilità e giocabilità entro limiti definiti, mentre chi sviluppa il gioco fornisce il segnale globale di verifica decidendo se la scena debba essere accettata. Lo sviluppo di videogiochi fornisce anche dati di traiettorie a lungo orizzonte provenienti dal mondo reale per il post-addestramento mediante RL. Proponiamo quindi Reinforcement Learning with Human-Engine Verification (RLHEV), un paradigma di post-addestramento che combina i segnali dettagliati del motore con il feedback implicito di accettazione umana derivante dal processo di sviluppo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv