Ricerca
RRSI: auto-miglioramento ricorsivo regolarizzato dei sistemi di supporto agli agenti
Le capacità di un agente basato su un LLM sono amplificate in larga misura dal suo harness, ossia dai prompt, dal flusso di controllo, dagli strumenti, dalla memoria e dalla gestione del contesto che

- arXiv
- 2609.24972
- Pubblicato
- 2026-09-21
- Autori
- Peng Xia, Rujun Han, Zifeng Wang, Yanfei Chen, Yufan Zhang, Yoonho Lee, Chengsong Huang, Han Yu, Zhongying CuiZhu, Yifei Ming, Huaxiu Yao, Burak Gokturk, Tomas Pfister, Chen-Yu Lee
Abstract degli autori
Le capacità di un agente basato su un LLM sono amplificate in larga misura dal suo harness, ossia dai prompt, dal flusso di controllo, dagli strumenti, dalla memoria e dalla gestione del contesto che circondano il modello backbone congelato. I metodi recenti automatizzano sempre più questo processo proponendo e selezionando iterativamente modifiche ai singoli componenti dell’harness di un agente, dando così vita, in pratica, a una forma di auto-miglioramento ricorsivo (RSI) a livello del sistema agentico. Tuttavia, questa evoluzione ricorsiva può produrre overfitting memorizzando i compiti di addestramento: i notevoli miglioramenti ottenuti sui dati della stessa distribuzione si riducono, o addirittura scompaiono, nei benchmark fuori distribuzione. Presentiamo Regularized Recursive Self-Improvement of Agent Harnesses (RRSI), che applica i principi della regolarizzazione all’auto-miglioramento degli harness imponendo vincoli alla proposta e alla selezione dei candidati nell’evoluzione. Il proponente opera con un budget ridotto gradualmente nel tempo, che limita il numero di modifiche raggruppabili in un candidato, e favorisce le traiettorie ancora inesplorate sulla base della storia dell’evoluzione. Il selettore dispone di un critico e di un componente di potatura: il critico filtra le proposte specifiche per un benchmark, mentre il componente di potatura elimina le modifiche troppo piccole, troppo costose o non più utili. Insieme, questi vincoli favoriscono meccanismi degli agenti riutilizzabili rispetto a quelli specifici per un benchmark o al semplice rumore. Su otto benchmark che comprendono compiti di programmazione, ambienti di lavoro agentici e progettazione ingegneristica, RRSI ottiene miglioramenti fino a 14,1 punti sulla suddivisione dei dati rispetto alla quale si evolve e fino a 4,7 punti sui cinque benchmark fuori distribuzione, producendo al contempo un harness che funziona con il 30% di token della policy in meno rispetto all’evoluzione non regolarizzata. Il codice è disponibile all’indirizzo https://github.com/google-research/rrsi e la pagina del progetto è https://regularized-rsi.com/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv