Vai al contenuto
AI.info

Ricerca

GameWAM: un modello mondo-azione per i videogiochi

I videogiochi moderni combinano percezione in prima persona, rapidi cambiamenti visivi, uno stato persistente del mondo e sistemi di controllo nativi eterogenei. Gli agenti di gioco esistenti traducon

GameWAM: un modello mondo-azione per i videogiochi
arXiv
2608.26200
Pubblicato
2026-08-25
Autori
Yuncheng Guo, Zhanqiu Zhang, Yiwen Guo, Weijia Li

Abstract degli autori

I videogiochi moderni combinano percezione in prima persona, rapidi cambiamenti visivi, uno stato persistente del mondo e sistemi di controllo nativi eterogenei. Gli agenti di gioco esistenti traducono direttamente il contesto visivo e quello del compito in azioni, ma non modellano esplicitamente le dinamiche del mondo. I modelli interattivi del mondo di gioco, invece, prevedono gli stati visivi futuri a partire dalle azioni fornite, ma non fungono da politiche per svolgere i compiti. I modelli mondo-azione (World-Action Models, WAMs) unificano questi obiettivi, ma restano in gran parte inesplorati nel contesto delle dinamiche e dell’interazione aperta dei videogiochi. Presentiamo GameWAM, a quanto ci risulta il primo WAM per il gameplay nativo a ciclo chiuso e il controllo delle interfacce grafiche (GUI). GameWAM genera congiuntamente osservazioni visive future e traiettorie eseguibili di input da tastiera e mouse mediante processi generativi paralleli per la componente visiva e quella delle azioni, con condizionamento causale a blocchi e flow matching. Per consentire l’apprendimento congiunto del mondo e delle azioni, costruiamo traiettorie sincronizzate di gameplay e interazione con le GUI. Per gestire sistemi di controllo nativi eterogenei, GameWAM prevede una modalità gameplay/GUI per ogni passo d’azione e genera azioni usando distribuzioni predittive specifiche per ciascuna modalità e la normalizzazione delle azioni continue. Per le interazioni di lunga durata, il controllo a cicli di blocchi coordina previsione, esecuzione e contesto temporale: estende le previsioni oltre l’orizzonte delle azioni già stabilite, esegue brevi blocchi di azioni, ricalcola il piano in base alle nuove osservazioni e organizza gerarchicamente il contesto, dalla cronologia dettagliata all’interno di ciascun ciclo a quella persistente tra cicli. Gli esperimenti mostrano risultati competitivi nel completamento dei compiti, con meno azioni native eseguite rispetto agli agenti usati nel confronto. Individuiamo inoltre il Low-Frequency Action Source Imprinting (LASI), per cui le componenti a bassa frequenza della sorgente di azioni campionata orientano sistematicamente il movimento generale della telecamera generato, a condizionamento fissato. Questo rivela una modalità di errore nel controllo generativo dovuta alla sensibilità alla sorgente. La pagina del progetto è disponibile all’indirizzo https://yunncheng.github.io/GameWAM/.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv