The Pulse
Un paper su RRSI descrive un metodo per migliorare gli harness degli agenti
L’abstract su arXiv riferisce che RRSI migliora le prestazioni sia sullo split usato per l’evoluzione sia su cinque benchmark fuori distribuzione, riducendo al contempo l’uso di token della policy.

AI.info Team ·
Un paper pubblicato su arXiv descrive un metodo per migliorare l’harness di un agente di IA: l’insieme di prompt, flusso di controllo, strumenti, memoria e gestione del contesto che circonda un modello linguistico congelato. Il metodo, chiamato Regularized Recursive Self-Improvement of Agent Harnesses, o RRSI, propone e seleziona ripetutamente modifiche a questo sistema circostante, anziché riaddestrare il modello sottostante.
Il paper inquadra l’approccio come un processo ricorsivo di auto-miglioramento a livello di sistema agente. Il modello di base rimane congelato mentre l’harness cambia attraverso un processo automatizzato che valuta le modifiche candidate. Gli autori affermano che gli approcci esistenti possono sovradattarsi alle attività usate durante il miglioramento, ottenendo grandi incrementi su quelle attività che si riducono o scompaiono quando il sistema viene testato altrove.
Risultati su otto benchmark
RRSI viene valutato su otto benchmark che spaziano dalla programmazione alle attività agentiche in ambienti di lavoro, fino alla progettazione ingegneristica. Il paper riporta incrementi fino a 14,1 punti sullo split usato per evolvere l’harness. Su cinque benchmark fuori distribuzione, il metodo produce incrementi fino a 4,7 punti.
L’harness evoluto funziona inoltre usando il 30% di token della policy in meno rispetto a un processo di evoluzione non regolarizzato. Secondo la descrizione del paper, il risultato intende mostrare che i vincoli imposti alla ricerca possono favorire modifiche che continuano a funzionare anche al di là delle attività usate per generarle, anziché modifiche che si limitano a memorizzare schemi specifici dei benchmark.
Vincoli sulle modifiche candidate
RRSI limita il numero di modifiche che una candidata può riunire, tramite un budget sottoposto ad annealing temporale. Il processo di proposta può usare la cronologia dell’evoluzione per incoraggiare traiettorie inesplorate, riducendo la probabilità che segua ripetutamente lo stesso percorso senza successo.
Il processo di selezione aggiunge due componenti: un critico e un modulo di potatura. Secondo l’abstract, il critico filtra le proposte che sembrano specifiche del benchmark. Il modulo di potatura elimina le modifiche troppo piccole, troppo costose o non più utili. Nel loro insieme, queste restrizioni mirano a favorire meccanismi riutilizzabili per gli agenti, anziché modifiche specifiche del benchmark o rumore.
Il paper descrive l’harness come un ampio livello software che circonda il modello. Gli elementi modificabili possono comprendere prompt, flusso di controllo, strumenti, memoria e gestione del contesto. Ciò consente al metodo di cercare cambiamenti nel modo in cui un agente è organizzato e opera, mantenendo fisso il modello linguistico sottostante.
Cosa sostiene il paper
La tesi centrale è più circoscritta rispetto all’idea di un agente che riprogetta autonomamente un intero sistema di IA. RRSI è una procedura controllata per proporre, testare e selezionare modifiche a un harness definito. I risultati riportati riguardano le prestazioni sui benchmark e l’uso di token della policy nell’ambito di tale procedura.
Gli autori affermano che il metodo affronta una debolezza specifica dell’evoluzione ricorsiva degli harness: i miglioramenti ottenuti sulle attività usate per lo sviluppo potrebbero non trasferirsi a nuove attività. Ponendo vincoli sia alle proposte candidate sia al processo di selezione, RRSI mira a individuare modifiche che restino utili al di fuori dello split usato per l’evoluzione.
Il paper è stato inviato ad arXiv il 21 settembre 2026. L’abstract afferma che il codice è disponibile tramite una risorsa collegata del progetto.