Vai al contenuto
AI.info

Ricerca

MNIST-PRO: MNIST torna come mondo parzialmente osservabile per gli agenti di IA

Negli ambienti parzialmente osservabili, gli agenti di IA devono coordinare l’osservazione attiva con la memoria di lavoro per mantenere uno stato percettivo che si evolve nel tempo. I benchmark esist

MNIST-PRO: MNIST torna come mondo parzialmente osservabile per gli agenti di IA
arXiv
2608.31022
Pubblicato
2026-08-31
Autori
Vernon Toh, Navonil Majumder, Zhengyuan Liu, Nancy F. Chen, Soujanya Poria

Abstract degli autori

Negli ambienti parzialmente osservabili, gli agenti di IA devono coordinare l’osservazione attiva con la memoria di lavoro per mantenere uno stato percettivo che si evolve nel tempo. I benchmark esistenti, però, faticano a isolare questa capacità di costruire e interpretare uno stato percettivo, perché introducono complessità fisiche e di controllo. Per affrontare il problema, presentiamo MNIST-PRO, un benchmark che isola la percezione degli agenti trasformando il riconoscimento delle cifre di MNIST in un compito di ricerca sequenziale basato su osservazioni parziali, con vincoli sulla consultazione delle osservazioni precedenti. Valutiamo dieci modelli multimodali con quattro rappresentazioni della memoria: una cronologia visiva grezza, stati testuali, mappe metriche strutturate a griglia e un quadro visivo consolidato. Sebbene i modelli ottengano risultati eccellenti in condizioni di piena osservabilità, l’osservabilità parziale mette in luce un netto divario nelle prestazioni. Individuiamo tre ostacoli distinti. Primo, costruire e interpretare lo stato percettivo è difficile: gli agenti faticano a integrare osservazioni frammentarie. Secondo, spesso smettono di esplorare prima di aver visto l’intera sequenza. Terzo, i modelli spesso non riescono a correggere convinzioni iniziali errate neppure di fronte a successive prove contrarie. Questi risultati mostrano che acquisire prove visive non basta: gli agenti devono anche saper costruire e aggiornare uno stato percettivo affidabile.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv