Ricerca
RSIGame: sviluppo autonomo di giochi basato su agenti con auto-miglioramento ricorsivo
I recenti progressi dei modelli linguistici di grandi dimensioni hanno reso sempre più fattibile la generazione automatica di giochi, ma migliorare in modo affidabile i giochi generati oltre una versi

- arXiv
- 2609.39045
- Pubblicato
- 2026-09-30
- Autori
- Wenyi Wu, Minghao Fu, Jieyu You, Kun Zhou, Siqi Liu, Aayush Salvi, Yiheng Lin, Ce Zhang, Xiaohan Lan, Jiahui Zhu, Yujie Zhong, Qi She, Biwei Huang
Abstract degli autori
I recenti progressi dei modelli linguistici di grandi dimensioni hanno reso sempre più fattibile la generazione automatica di giochi, ma migliorare in modo affidabile i giochi generati oltre una versione giocabile resta difficile. Un perfezionamento iterativo ingenuo può facilmente adattarsi troppo a un piccolo insieme di casi di test, producendo giochi fragili, con bug irrisolti, comportamenti mancanti e scarsa capacità di generalizzare a una gamma più ampia di interazioni dei giocatori. Presentiamo RSIGame, un framework per lo sviluppo autonomo di giochi basato su agenti e dotato di auto-miglioramento ricorsivo. RSIGame organizza lo sviluppo in cicli locali e globali complementari. In concreto, un ciclo locale di esplorazione, diagnosi e miglioramento esplora ampiamente il gioco eseguibile, individua i problemi emersi e ne stabilisce le priorità, quindi apporta modifiche basate sulle evidenze. Una checklist in evoluzione raccoglie continuamente nuove indicazioni per i test e il miglioramento. Un ciclo globale monitora la qualità complessiva, conserva il miglior checkpoint e rileva quando lo sviluppo si arresta o regredisce nel lungo periodo. Oltre al miglioramento in fase di test, RSIGame incorpora nel generatore, tramite addestramento, l’esperienza acquisita con gli interventi di sviluppo riusciti. Su 140 attività di GameCraft-Bench, due motori di gioco e cinque generatori, RSIGame migliora sistematicamente la qualità dei giochi a parità di budget di sviluppo. In particolare, l’internalizzazione dell’esperienza consente a Qwen3.8-27B di raggiungere un punteggio di 61,38 su Godot e 58,53 su Phaser, superando i punteggi one-shot di GPT-5.5 e riducendo di 11 volte i token usati da Qwen per la generazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv