Vai al contenuto
AI.info

Ricerca

SWE-Game: gli agenti di programmazione possono creare i giochi che vogliamo?

Presentiamo SWE-Game, un benchmark di 247 compiti basati su 41 giochi di riferimento eseguibili realizzati in Godot, che coprono 13 categorie di gameplay in 2D e 3D. I cinque tipi di compito comprendo

SWE-Game: gli agenti di programmazione possono creare i giochi che vogliamo?
arXiv
2609.33678
Pubblicato
2026-09-27
Autori
Xiaoyu Chen, Lai Wei, Jin Wang, Xiangyu Zou, Ruochen Fan, Enze Luo, Mingzhe Yao, Jiahui Zhu, Yuhua Wen, Linghe Kong, Weiran Huang

Abstract degli autori

Presentiamo SWE-Game, un benchmark di 247 compiti basati su 41 giochi di riferimento eseguibili realizzati in Godot, che coprono 13 categorie di gameplay in 2D e 3D. I cinque tipi di compito comprendono lo sviluppo a partire da un brief, l’implementazione a partire da un documento di game design, il completamento di uno scheletro, la riparazione di 83 casi con difetti introdotti e il porting da Godot a Unity. I materiali di riferimento specificano il gameplay previsto, mentre un’interfaccia di strumentazione condivisa consente a driver e sonde gestiti dai valutatori di eseguire azioni e osservare giochi implementati in modo indipendente. La valutazione combina verifiche dello stato del motore, riproduzione certificata degli input di riferimento e dimostrazioni delle funzionalità preparate dagli agenti per misurare la correttezza delle meccaniche, la giocabilità dimostrata e il ripristino e la conservazione dei comportamenti dopo le riparazioni. Griglie di valutazione visivo-linguistiche specifiche per ciascun gioco valutano separatamente la presentazione. Tra sei modelli, Opus5 ottiene il punteggio complessivo più alto in tutti e cinque i tipi di compito. Nei tre compiti di costruzione, i migliori punteggi complessivi restano inferiori a 60 su 100; Brief-to-Game raggiunge 50,38. L’analisi delle soluzioni esaminate individua nelle omissioni dei requisiti e negli errori nella logica di gioco i problemi di implementazione predominanti. Sui comportamenti di 100 giochi creati dagli agenti ed etichettati da persone, le verifiche eseguibili raggiungono un’accuratezza bilanciata del 92,59%, contro il 78,41% di un valutatore VLM basato su video. I punteggi visivi basati sulle griglie di valutazione raggiungono una correlazione di Spearman di 0,829 con le valutazioni umane di 200 clip di gameplay. Nel complesso, questi risultati delineano le capacità attuali degli agenti nelle attività di sviluppo di giochi e sostengono l’uso congiunto di dati raccolti durante l’esecuzione e valutazioni visive.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv