Vai al contenuto
AI.info

Ricerca

ModularRSI: auto-miglioramento ricorsivo degli harness, modulare e generalizzabile

Lavori recenti hanno esteso l’auto-miglioramento ricorsivo (RSI) agli harness per agenti impegnati in compiti di programmazione e di uso del terminale su orizzonti temporali lunghi, consentendo agli a

ModularRSI: auto-miglioramento ricorsivo degli harness, modulare e generalizzabile
arXiv
2609.14857
Pubblicato
2026-09-14
Autori
Siwei Wu, Jincheng Ren, Yizhi Li, Haau-Sing Li, Chengran Yang, Yuxuan Zhang, Weicheng Gu, Jian Yang, Riza Batista-Navarro, Chuanyi Zhang, Xianglong Liu, Ming Zhou, Bryan Dai, Chenghua Lin

Abstract degli autori

Lavori recenti hanno esteso l’auto-miglioramento ricorsivo (RSI) agli harness per agenti impegnati in compiti di programmazione e di uso del terminale su orizzonti temporali lunghi, consentendo agli agenti di migliorare i propri meccanismi di esecuzione sulla base dell’esperienza. Resta tuttavia difficile ottenere un RSI degli harness che sia generalizzabile. In primo luogo, far evolvere gli harness sui benchmark di valutazione o su loro sottoinsiemi rende difficile distinguere i miglioramenti riutilizzabili dagli adattamenti specifici ai benchmark. In secondo luogo, gli aggiornamenti basati su una sola traiettoria possono confondere le carenze sistematiche dell’harness con dettagli del ragionamento e della soluzione specifici del singolo caso, producendo modifiche che si trasferiscono poco a compiti mai visti. In terzo luogo, è difficile individuare le carenze comportamentali ricorrenti all’interno di harness monolitici, mentre l’ottimizzazione dell’intero harness può intrecciare meccanismi non correlati e complicare l’attribuzione e la verifica dei risultati. Proponiamo ModularRSI, un framework contrastivo e modulare per l’evoluzione generalizzabile degli harness, che utilizza per l’evoluzione compiti distinti da quelli dei benchmark di valutazione. ModularRSI confronta le traiettorie riuscite e quelle fallite per lo stesso compito e aggrega le evidenze raccolte su più compiti per individuare carenze comportamentali ricorrenti. Suddivide l’harness modificabile in cinque moduli funzionali: Agent Loop, Tool Use, Observation Management, Context Management e Task Completion Detection. Ogni modulo evolve indipendentemente entro un ambito di modifica circoscritto; segue una fase di integrazione che riunisce i moduli così evoluti in un unico harness e risolve i potenziali conflitti. Per consentire un’evoluzione basata su compiti distinti da quelli dei benchmark, raccogliamo da fonti esterne 2.000 compiti di evoluzione eseguibili, distinti da quelli dei benchmark usati per la successiva valutazione. Gli esperimenti su TB2.0 e SWE-Bench Verified mostrano miglioramenti costanti su compiti mai visti, sia nello stesso dominio sia in domini diversi. L’harness così evoluto si trasferisce inoltre tra diversi modelli di base.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv