The Pulse
Dream-RSI riduce i costi della scoperta con l’IA riproducendo la cronologia dell’agente
Un articolo su arXiv presenta Dream-RSI, un sistema che usa alberi di scoperta storici come simulatori di replay per testare e migliorare le strategie di esplorazione prima di applicarle a ricerche online costose.

AI.info Team ·
Dream-RSI usa la cronologia per ridurre i costi della scoperta
Un nuovo sistema di ricerca riferisce di aver eguagliato o migliorato diversi risultati ottenuti con l’IA, usando meno chiamate all’agente rispetto ai metodi esistenti. Dream-RSI tratta le cronologie di scoperta completate come simulatori di replay, consentendo di testare strategie di esplorazione alternative senza generare ripetutamente codice o eseguire di nuovo i valutatori.
Il lavoro, presentato in un articolo di 12 pagine su arXiv inviato il 14 settembre 2026, affronta un punto debole dei sistemi autonomi di scoperta: le strategie di esplorazione possono restare immutate anche dopo che un agente ha raccolto prove su quali percorsi di ricerca funzionano e quali no.
«La nostra intuizione chiave è che la cronologia accumulata delle scoperte può fungere da simulatore di replay dello spazio di ricerca effettivamente esplorato.»
Tong Zheng, primo autore dell’articolo
Dream-RSI, acronimo di auto-miglioramento ricorsivo attraverso mondi in evoluzione, archivia le cronologie di scoperta sotto forma di alberi con rami, artefatti generati, risultati delle valutazioni, diagnostica e punteggi. Le strategie di esplorazione candidate possono muoversi all’interno di questi alberi registrati senza generare nuovo codice o eseguire di nuovo il valutatore.
La cronologia diventa un banco di prova per nuove strategie di ricerca
Il metodo suddivide la scoperta in fasi online e offline. Durante l’esplorazione online, un agente di programmazione segue una strategia eseguibile che decide quali rami ampliare, quanti tentativi eseguire in parallelo e quando fermarsi. Ogni esecuzione completata aggiunge un nuovo albero di scoperta alla cronologia del sistema.
Durante la fase offline di «simulazione», un agente che sviluppa strategie ne modifica il codice di esplorazione e testa ogni versione sugli alberi archiviati. Il replay restituisce in modo deterministico gli esiti registrati in precedenza, consentendo al sistema di confrontare scelte di rami, ordini di esplorazione, dimensioni dei batch e decisioni di arresto alternativi senza sostenere il costo di un’altra esecuzione completa della scoperta.
Il punteggio di replay dell’articolo combina tre elementi: la soluzione migliore trovata, una penalità legata al numero di tentativi rappresentati e un bonus per aver completato più tentativi per round decisionale. Dream-RSI seleziona la versione della strategia con le prestazioni migliori sulla cronologia accumulata, la impiega in una nuova esecuzione online e aggiunge quest’ultima al pool di replay.
Costi inferiori nella scoperta di un risolutore Lasso
Il risultato più chiaro riguarda un’attività di ingegneria degli algoritmi volta a individuare un risolutore efficiente per il percorso di regolarizzazione Lasso. I ricercatori valutano i programmi ottenuti su sei dataset tenuti da parte, relativi a carichi di lavoro biologici e non biologici, e confrontano poi Dream-RSI con librerie standard, SimpleTES e una strategia di esplorazione fissa.
Usando Gemini-3.1 Pro come agente di scoperta, Dream-RSI ottiene un tempo medio di esecuzione di 2.931,0 millisecondi sui sei dataset, con 317 chiamate all’agente di scoperta. Recursive Fixed Exploration registra un tempo medio di esecuzione di 3.587,1 millisecondi, con 550 chiamate.
Un secondo esperimento con Gemini-3.7 Flash rileva un miglioramento minore, ma comunque misurabile. Dream-RSI raggiunge un tempo medio di esecuzione di 2.350,6 millisecondi con 1.879 chiamate, contro i 2.516,7 millisecondi e le 3.200 chiamate dell’esplorazione fissa. Secondo l’articolo, entrambi i risolutori scoperti superano le implementazioni standard di sklearn e glmnet su tutti e sei i dataset tenuti da parte.
Il risparmio riportato è misurato in chiamate all’agente di scoperta e non equivale a un’affermazione sul consumo totale di elettricità, sui costi in dollari o sul tempo effettivo di esecuzione di tutte le componenti del sistema. Rispetto a SimpleTES, che nel confronto citato usa 51.200 generazioni, Dream-RSI ottiene un tempo medio di esecuzione a valle inferiore con circa due ordini di grandezza in meno di chiamate all’agente di scoperta.
Risultati in matematica e nei kernel GPU
I ricercatori testano Dream-RSI su otto attività nell’ambito dell’ingegneria degli algoritmi, dell’ottimizzazione matematica e dell’ingegneria dei kernel GPU. Nell’ottimizzazione matematica, il sistema eguaglia o supera solide prestazioni di riferimento entro 1.000 generazioni, con un risparmio sul budget superiore a 50 volte rispetto a SimpleTES.
Gli esperimenti sui kernel GPU riguardano quattro attività di KernelBench: VGG16, LayerNorm, ConvDiv e ConvMax. Dream-RSI raggiunge le velocità di esecuzione obiettivo con 2,43 volte meno generazioni su VGG16 e 1,79 volte meno su LayerNorm. A parità di vincoli di budget, registra prestazioni fino a 2,09 volte superiori su ConvDiv e fino a 1,44 volte superiori su ConvMax.
Per gli esperimenti sui kernel il sistema usa Gemini-3.1 Pro e mantiene agente di programmazione, valutatore, inizializzazione e limiti delle risorse allineati al confronto con l’esplorazione fissa. Tra un round ricorsivo e l’altro cambia solo il codice della strategia di esplorazione.
Il replay migliora la ricerca senza imporre un’unica direzione
L’articolo confronta inoltre il replay interattivo con un approccio più semplice, che riassume le esecuzioni precedenti sotto forma di indicazioni generali e le inserisce nei prompt successivi. Nell’attività del kernel ConvDiv, a parità di budget, le indicazioni esplicite ottengono risultati peggiori del metodo basato sul replay.
Gli autori attribuiscono la differenza al fatto che le istruzioni generali possono restringere troppo presto la ricerca. Il replay permette a una strategia di esaminare rami concreti e risultati registrati, mantenendo la possibilità di esplorare percorsi diversi, modificare il parallelismo o interrompere il lavoro improduttivo. In un’analisi, la strategia in evoluzione riduce inizialmente il numero di tentativi valutati da 110 a 50, mentre le prestazioni migliorano; poi aumenta di nuovo l’esplorazione quando i progressi si arrestano.
Un’affermazione circoscritta, con implicazioni più ampie
Dream-RSI non modifica l’agente di programmazione, il valutatore o l’interfaccia di esecuzione sottostanti. Cambia il sistema di controllo che distribuisce le risorse dedicate alla scoperta; il suo contributo consiste nel rendere quel sistema verificabile sulla base della cronologia prima di avviare un’altra costosa esecuzione online.
I risultati riportati provengono dagli esperimenti di un singolo articolo inviato ad arXiv e non dimostrano che l’approccio possa essere trasferito senza modifiche a tutti gli agenti autonomi o a ogni problema di ricerca scientifica. Mostrano un’alternativa all’uso della cronologia dell’agente come semplice contesto: registrarne la struttura ramificata e gli esiti, poi usare quei dati per valutare nuovi comportamenti di ricerca prima di spendere altre chiamate.
L’articolo è disponibile su arXiv, insieme ai materiali del progetto collegati a Dream-RSI.