Vai al contenuto
AI.info

Ricerca

ExplorationBench: misurare l’esplorazione dei sistemi di IA in mondi alieni verificabili

La scoperta scientifica comincia dove finiscono i problemi noti. È lì che i sistemi di IA devono esplorare: formulare ipotesi, progettare esperimenti e iterare sui risultati. Valutare questa capacità,

ExplorationBench: misurare l’esplorazione dei sistemi di IA in mondi alieni verificabili
arXiv
2609.30199
Pubblicato
2026-09-24
Autori
Ming Zhang, Zhenghao Xiang, Peizhong Gao, Yujiong Shen, Yuhui Wang, Zhonghan Yue, Shihan Dou, Zhangyue Yin, Junjie Ye, Shichun Liu, Weihuang Zheng, Jiahao Chen, Jiayi Chen, Hongzhang Liu, Jiaqi Shao, Tao Gui, Qi Zhang, Xuanjing Huang, Suncong Zheng, Maxm Pan

Abstract degli autori

La scoperta scientifica comincia dove finiscono i problemi noti. È lì che i sistemi di IA devono esplorare: formulare ipotesi, progettare esperimenti e iterare sui risultati. Valutare questa capacità, però, è difficile: (1) come verificare se un’ipotesi davvero nuova è valida e (2) come determinare se un sistema l’ha scoperta esplorando o si è limitato a richiamare conoscenze correlate dai dati di pre-training. A questo scopo, presentiamo ExplorationBench, che trasforma il problema spinoso di valutare l’esplorazione scientifica in un quadro concreto e gestibile, basato su mondi alieni verificabili: le loro regole sono eseguibili, quindi ogni risposta può essere verificata con precisione, e sono in contrasto con le conoscenze familiari, perciò il solo richiamo mnemonico non basta a risolvere i compiti. Il benchmark comprende due ambienti sandbox, AlienCode (31 obiettivi di scoperta, 70 compiti) e AlienLogic (24 obiettivi di scoperta, 70 compiti). Ciascun ambiente fornisce un manuale con errori, feedback ambientale specifico per ogni compito e uno schema dedicato per le chiamate agli strumenti. I sistemi usano queste risorse per esplorare l’ambiente e poi risolvere compiti tenuti da parte. Valutiamo 10 sistemi di IA e rileviamo che i sistemi più efficaci riescono ad acquisire e applicare regole non familiari, mentre le prestazioni variano notevolmente da un percorso all’altro e l’esplorazione prolungata può arrestarsi o annullare i progressi precedenti. ExplorationBench rappresenta un passo avanti verso sistemi di IA capaci di acquisire e applicare conoscenze davvero nuove esplorando ambienti sconosciuti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv