Vai al contenuto
AI.info

Ricerca

Game Arena: valutazione strategica degli LLM in ambienti competitivi

Presentiamo Kaggle Game Arena, una piattaforma aperta e in continua espansione per valutare i modelli linguistici di grandi dimensioni (LLM) attraverso giochi competitivi. A differenza dei benchmark s

Game Arena: valutazione strategica degli LLM in ambienti competitivi
arXiv
2609.31473
Pubblicato
2026-09-25
Autori
Bovard Doerschuk-Tiberi, Yao Yan, Justin Chiu, Hann Wang, Timothy Chung, Martyna Plomecka, John Schultz, Jon Lipovetz, Clayton Drazner, Yuchen Zhuang, Jaimie Hwang, Nate Keating, Riley Jones, Andrew Lee, Oran Kelly, Ian Gemp, Michael Aaron, Laurel Prince, Kate Larson, Jeff Moser, Harrison Jobe, Chad Woodford, Siqi Liu, Andrew Wang, Bo Chang, Christopher D'Mello, Diane Chaleff, Addison Howard, Johnny Yip, Chuck Sugnet, Antonio Gulli, Meghan O'Connell, Will Cukierski, Nenad Tomasev, Dima Yeroshenko, Kinjal Parekh, Roxanne Daniel, Marc Lanctot, Domino Weir, Elsa Dong, Daniel Hennes, Melissa Nalubwama, Robert Fraser, Ryan Trostle, Jun Peng, Tom Mason, Lloyd Hightower, Chiamaka Chukwuka, Yuexiang Zhai, Phoebe Kirk, Yi Su, Yuting Han, Jie Ren, Chris Prichard, Sahand Sharifzadeh, Karim Hakimzadeh, DJ Sterling, Meg Risdal, Kate Olszewska, Ya Xu, Orhan Firat, Minmin Chen

Abstract degli autori

Presentiamo Kaggle Game Arena, una piattaforma aperta e in continua espansione per valutare i modelli linguistici di grandi dimensioni (LLM) attraverso giochi competitivi. A differenza dei benchmark statici, Game Arena consente ai modelli di sfidarsi direttamente in ambienti strutturati, in cui la loro abilità di gioco aumenta naturalmente con l’evoluzione dei modelli, evitando che le prestazioni raggiungano un punto di saturazione. Questo rapporto tecnico illustra l’infrastruttura alla base di Game Arena e descrive i tre ambienti di gioco pilota: Chess, Poker e Werewolf. Questi ambienti comprendono contesti di gioco a informazione perfetta, a informazione imperfetta e multigiocatore, consentendo uno studio sistematico della pianificazione strategica dei modelli, della loro capacità di adattamento e della loro robustezza in condizioni di incertezza. Per ogni gioco forniamo una descrizione dettagliata dell’ambiente, delle metriche di valutazione e dei risultati ottenuti da competizioni complete tra modelli. Grazie a un’infrastruttura solida e a una valutazione su larga scala basata sulla ground truth, Game Arena garantisce riproducibilità, trasparenza e generalizzabilità a nuovi giochi e varianti nel tempo.

Leggi il paper originale su arXiv