Vai al contenuto
AI.info

Ricerca

GameHorizon Suite: dati e valutazione su più orizzonti temporali nel gameplay

I videogiochi moderni offrono un banco di prova misurabile per i modelli di IA: mettono insieme comprensione visiva, scomposizione delle istruzioni, pianificazione degli obiettivi e controllo preciso

GameHorizon Suite: dati e valutazione su più orizzonti temporali nel gameplay
arXiv
2609.25001
Pubblicato
2026-09-21
Autori
Yiran Wang, Xingyilang Yin, Junfu Pu, Guangzhi Wang, Kaifeng Li, Mingyu Ouyang, Huiqiang Sun, Lingen Li, Cheng Cheng, Wangbo Yu, Honghao Chen, Xiaodong Cun, Chi-Man Pun, Zhiguo Cao, Ying Shan

Abstract degli autori

I videogiochi moderni offrono un banco di prova misurabile per i modelli di IA: mettono insieme comprensione visiva, scomposizione delle istruzioni, pianificazione degli obiettivi e controllo preciso delle azioni su più orizzonti temporali. I dataset e i benchmark esistenti, tuttavia, coprono una gamma ristretta di giochi, sono privi di istruzioni in linguaggio naturale oppure si basano su rollout online ad alta variabilità. Per affrontare questi limiti, presentiamo GameHorizon, una suite unificata di dati e valutazione che misura le capacità di gameplay su diversi orizzonti temporali per varie famiglie di modelli. GameHorizon Suite comprende tre componenti. Il primo, GameHorizon-Annotator, è una pipeline scalabile e automatizzata per annotare istruzioni su più orizzonti temporali. Il secondo, GameHorizon-Data, è il primo dataset di gameplay di giochi AAA su larga scala con video, azioni dei giocatori e istruzioni su più orizzonti temporali allineati nel tempo, realizzato mediante la pipeline. Comprende 5.000 ore di registrazioni da 21 giochi, raccolte da 100 giocatori umani esperti. Il terzo componente è GameHorizon-Bench, che consente test offline riproducibili e test online passo dopo passo. La modalità offline permette valutazioni riproducibili mediante migliaia di domande standardizzate, organizzate in tre compiti principali e una serie di varianti diagnostiche. La modalità online verifica invece se i punteggi offline riflettono le effettive capacità di gameplay e individua in quali passaggi specifici si verificano i fallimenti nel gameplay su lunghi orizzonti temporali. Con GameHorizon Suite valutiamo 47 modelli attraverso oltre un milione di chiamate ai modelli, mettendo in luce una gerarchia significativa della difficoltà dei compiti e differenze marcate nelle capacità dei modelli. Il nostro lavoro può offrire un metro di valutazione standardizzato delle capacità di gameplay su diversi orizzonti temporali e per diverse famiglie di modelli. Renderemo disponibili il nostro dataset, l’annotatore e il benchmark per agevolare la ricerca futura.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv