Ricerca
Memento 3: automiglioramento ricorsivo basato su modelli attraverso manuali di regole riflessivi
Per imparare ad agire in ambienti sconosciuti, gli agenti devono dedurre come funziona il mondo e rivedere ciò che hanno capito man mano che emergono nuove evidenze. Tuttavia, osservazioni limitate po
- arXiv
- 2610.11794
- Pubblicato
- 2026-10-08
- Autori
- Haoyu Zhao, Zhengxu Yu, Zhiyuan He, Meng Fang, Rasul Tutunov, Haitham Bou-Ammar, Weilin Luo, Jun Wang
Abstract degli autori
Per imparare ad agire in ambienti sconosciuti, gli agenti devono dedurre come funziona il mondo e rivedere ciò che hanno capito man mano che emergono nuove evidenze. Tuttavia, osservazioni limitate possono essere compatibili con più modelli del mondo, capaci di spiegare le interazioni passate ma di prevedere esiti diversi in stati mai incontrati. Presentiamo Memento 3, che si basa sulla serie Memento e consente ad agenti il cui LLM rimane invariato di apprendere continuamente modelli espliciti del mondo attraverso una memoria esterna. L’agente conserva un manuale di regole in linguaggio naturale come memoria semantica persistente: vi registra ipotesi rivedibili sulle dinamiche dell’ambiente, lasciando non specificati gli aspetti ancora sconosciuti. Traduce poi il manuale in codice eseguibile per formulare previsioni e pianificare. Attraverso un ciclo continuo di osservazione, riflessione, revisione delle regole, compilazione e verifica, l’agente usa gli errori di previsione per perfezionare sia il manuale sia il codice. Il codice aggiornato viene accettato solo se l’LLM lo giudica fedele al manuale e se una riesecuzione esatta a livello di singola cella riproduce le transizioni osservate. Studiamo questo processo come una via all’automiglioramento ricorsivo (RSI) basata su modelli: l’agente esplora autonomamente l’ambiente, rivede il proprio modello del mondo e usa gli aggiornamenti verificati per orientare le interazioni e l’apprendimento successivi, mentre l’LLM sottostante rimane invariato. Un’estensione basata su una popolazione mantiene più modelli del mondo in parallelo, condividendo le evidenze raccolte nelle interazioni e usando le loro previsioni per orientare l’esplorazione. Su ARC-AGI-3, l’agente con un solo modello completa ogni livello di tutti i 25 giochi pubblici, raggiunge un valore medio di Relative Human Action Efficiency (RHAE) pari a 100,0 e usa un numero di azioni pari al 44% di quelle umane. In un caso di studio su Atari Pong, un controllore a retroazione appreso vince per 21:0 in ciascuno dei tre episodi valutati, con aperture diverse, senza ulteriori chiamate all’LLM.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv