Vai al contenuto
AI.info

The Pulse

GameHorizon porta 5.000 ore di gameplay ai test sui sistemi di IA nei videogiochi

I ricercatori presentano GameHorizon, un dataset di gameplay e un benchmark realizzati a partire da 5.000 ore di registrazioni di 21 giochi AAA. La suite mette alla prova 47 modelli con domande offline e valutazioni online passo dopo passo,

GameHorizon porta 5.000 ore di gameplay ai test sui sistemi di IA nei videogiochi

AI.info Team ·

Cinquemila ore, 21 giochi, una suite di test

GameHorizon presenta un corpus di 5.000 ore di gameplay, progettato per verificare se i sistemi di IA siano in grado di comprendere istruzioni, pianificare nel tempo ed eseguire azioni all’interno di giochi commerciali. Il dataset copre 21 giochi ed è stato raccolto da 100 giocatori esperti, secondo il paper di ricerca pubblicato il 21 settembre 2026.

Il progetto combina video registrati, azioni dei giocatori e istruzioni allineate su più scale temporali. I suoi autori descrivono la raccolta come il primo dataset su larga scala di gameplay di giochi AAA a riunire questi tre elementi con annotazioni su più orizzonti temporali, offrendo ai ricercatori un modo per studiare sia le decisioni immediate sia gli obiettivi che si sviluppano lungo sequenze molto più estese.

Il lavoro è frutto di Yiran Wang, Xingyilang Yin, Junfu Pu e altri 12 autori. Il paper è catalogato nell’ambito della ricerca in computer vision e intelligenza artificiale ed è disponibile tramite la scheda di Robotics Center Research.

Dalle singole mosse agli obiettivi a lungo termine

GameHorizon suddivide il proprio sistema in tre parti. GameHorizon-Annotator offre una pipeline automatizzata per generare istruzioni su diversi orizzonti temporali, mentre GameHorizon-Data raccoglie le registrazioni di gameplay, le azioni e il linguaggio allineato che ne risultano.

GameHorizon-Bench fornisce il livello di valutazione. La sua prova offline utilizza migliaia di domande standardizzate, organizzate attorno a tre compiti principali e a ulteriori varianti diagnostiche. Il progetto mira a rendere possibili confronti ripetuti senza richiedere che ogni modello giochi la stessa sequenza di gioco dal vivo.

La distinzione è importante perché gli agenti di gioco devono affrontare contemporaneamente diversi problemi distinti. Un sistema può riconoscere ciò che appare sullo schermo, ma non riuscire a interpretare l’istruzione, scegliere un sotto-obiettivo appropriato o eseguire la sequenza di azioni necessaria. Una breve clip può mettere alla prova il riconoscimento visivo; un episodio lungo verifica se il modello mantiene l’obiettivo mentre le condizioni cambiano.

I test online verificano se i punteggi offline reggono

GameHorizon include anche una prova online passo dopo passo, che valuta gli agenti durante il gameplay attivo. Il paper afferma che i test online esaminano se le prestazioni sulle domande offline riflettano le effettive capacità di gioco e individuano i passaggi specifici in cui un’attività a orizzonte lungo si interrompe.

Questo abbinamento affronta un limite ben noto nella progettazione dei benchmark. I test offline sono più facili da riprodurre, ma possono separare un modello dai feedback e dalle conseguenze cumulative che caratterizzano un gioco interattivo. I test online forniscono tale interazione, mentre l’analisi a livello di singolo passaggio intende mostrare se un agente ha fallito nella percezione, nel seguire le istruzioni, nella pianificazione o nel controllo delle azioni.

Gli autori non presentano le due prove come intercambiabili. La suite utilizza invece la valutazione offline per misurazioni ripetibili e quella online per verificare come tali misurazioni si rapportino al comportamento all’interno di un ambiente.

47 modelli testati con oltre un milione di chiamate

I ricercatori valutano 47 modelli con oltre un milione di invocazioni. I sistemi testati appartengono a diverse famiglie di modelli, anche se l’abstract non presenta una tabella completa dei risultati per ciascun modello nella scheda di ricerca.

La valutazione mette in luce quella che gli autori definiscono una gerarchia di difficoltà dei compiti, insieme a differenze marcate tra le capacità dei modelli. Questi risultati avvalorano l’argomento centrale del paper: la competenza nel gameplay non si riduce a un unico punteggio. Le prestazioni dei modelli possono variare a seconda della lunghezza dell’istruzione, della quantità di interpretazione visiva richiesta e del numero di azioni necessarie per raggiungere un obiettivo.

GameHorizon considera quindi l’orizzonte temporale una dimensione di misurazione, anziché un dettaglio secondario. Un benchmark che indichi soltanto se un agente ha risposto correttamente a una singola domanda può non rilevare gli errori che emergono solo dopo diverse decisioni interdipendenti.

Un benchmark pensato per la riproducibilità

Secondo il paper, i dataset e le valutazioni di gameplay esistenti spesso si concentrano su un gruppo ristretto di giochi, omettono istruzioni in linguaggio naturale o dipendono in larga misura da esecuzioni online ad alta varianza. GameHorizon risponde combinando un’ampia raccolta di giochi con azioni, video e linguaggio allineati, e separando poi i test offline ripetibili dalle verifiche interattive.

Gli autori affermano di voler rilasciare il dataset, la pipeline di annotazione e il benchmark. La scheda di ricerca non specifica una data di rilascio, una licenza né l’elenco completo dei giochi, quindi questi dettagli non possono ancora essere considerati documentazione disponibile.

Per ora, il contributo concreto consiste nel progetto della valutazione e nelle dimensioni dichiarate della raccolta: 5.000 ore, 21 giochi, 100 giocatori umani e oltre un milione di invocazioni dei modelli. Restano aperte le domande su come si potrà accedere ai dati rilasciati, su come il benchmark impedirà la contaminazione dell’addestramento e su quanto costantemente i punteggi offline prediranno il successo nella prova online.

Fonti

Esplora

Altri articoli