Vai al contenuto
AI.info

Ricerca

Dream-RSI: auto-miglioramento ricorsivo attraverso mondi in evoluzione

L’auto-miglioramento ricorsivo sta diventando sempre più importante per gli agenti autonomi di IA, i cui progressi dipendono dalla scoperta di soluzioni di alto valore in ambiti complessi. Il motore d

Dream-RSI: auto-miglioramento ricorsivo attraverso mondi in evoluzione
arXiv
2609.14858
Pubblicato
2026-09-14
Autori
Tong Zheng, Xidong Wu, Zheng Zhang, Zhankui He, Chaoyi Zhang, Benjamin Coleman, Ruoqiao Wei, Di Bai, Haolin Liu, Rui Liu, Xue Wang, Yue Zhuan, Wang-Cheng Kang, Renkai Xiang, Heng Huang, Xinwu Cheng, Yunsong Guo

Abstract degli autori

L’auto-miglioramento ricorsivo sta diventando sempre più importante per gli agenti autonomi di IA, i cui progressi dipendono dalla scoperta di soluzioni di alto valore in ambiti complessi. Il motore di questo processo è un’esplorazione efficace, ma gestire e migliorare le strategie di esplorazione resta un ostacolo importante. I sistemi attuali si trovano di fronte a un dilemma fondamentale: le strategie fisse non riescono ad adattarsi quando gli spazi di ricerca crescono, mentre l’ottimizzazione online delle politiche richiede di orientarsi in vasti spazi di meta-ricerca, con feedback tardivi e costosi su rollout a lungo orizzonte. Presentiamo \textsc{Dream-RSI}, un framework per un’esplorazione scalabile e capace di auto-migliorarsi ricorsivamente. Un livello leggero di orchestrazione rende l’esplorazione esplicita e programmabile, lasciando invariato l’agente di programmazione sottostante. L’intuizione centrale è che la storia delle scoperte accumulate può fungere da simulatore di replay dello spazio di ricerca effettivamente realizzato. Attraverso il dreaming nel simulatore di replay costruito a partire dagli alberi delle scoperte passate, \textsc{Dream-RSI} ottiene feedback off-policy immediati e a basso costo per valutare e affinare le politiche di esplorazione, senza ricorrere a valutazioni online ripetute e costose. La politica migliorata viene poi impiegata nuovamente online per favorire ulteriori scoperte, ampliando continuamente l’insieme dei simulatori in un ciclo di auto-miglioramento. Nell’ingegneria degli algoritmi, nell’ottimizzazione matematica e nell’ingegneria dei kernel GPU, \textsc{Dream-RSI} raggiunge una qualità delle scoperte competitiva o superiore, riducendone sostanzialmente il costo in diversi contesti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv