Vai al contenuto
AI.info

Ricerca

Auto-miglioramento ricorsivo degli agenti di ricerca nell’IA

Gli agenti di IA stanno iniziando ad automatizzare la ricerca e lo sviluppo nell’intero stack dell’IA, dal miglioramento dell’efficienza dell’addestramento all’ottimizzazione dell’inferenza. Un passo

Auto-miglioramento ricorsivo degli agenti di ricerca nell’IA
arXiv
2609.26457
Pubblicato
2026-09-22
Autori
Dhruv Srikanth, Bingchen Zhao, Dixing Xu, Yuxiang Wu, Zhengyao Jiang

Abstract degli autori

Gli agenti di IA stanno iniziando ad automatizzare la ricerca e lo sviluppo nell’intero stack dell’IA, dal miglioramento dell’efficienza dell’addestramento all’ottimizzazione dell’inferenza. Un passo successivo naturale consiste nel migliorare l’efficienza della ricerca degli agenti stessi. Quando il codice di un agente di ricerca basato sull’IA diventa l’oggetto dell’ottimizzazione, ogni riscrittura accettata diventa l’agente che verrà modificato nel ciclo successivo. Chiamiamo questo processo miglioramento ricorsivo di sé. La sua importanza deriva da una tendenza di lunga data: all’aumento della spesa cumulativa per la ricerca e lo sviluppo corrispondono rendimenti decrescenti. Un auto-miglioramento sostenuto offre un modo per contrastare questa tendenza. Presentiamo AIDE^2, un sistema che applica questo ciclo a un agente di ricerca basato sull’IA all’avanguardia. Il sistema propone modifiche al proprio codice, valuta versioni modificate di sé stesso su una serie di attività di ricerca e sviluppo nell’IA e conserva le modifiche che ottengono i risultati migliori nelle valutazioni nascoste. Nel corso di una prova autonoma di 8 giorni, AIDE^2 ha individuato sette miglioramenti successivi, che spaziano da una nuova strategia di ricerca a meccanismi di memoria che comprimono e gestiscono il contesto crescente dell’agente. Questi risultati si generalizzano a quattro benchmark non utilizzati in fase di selezione, che spaziano dall’ingegneria del machine learning all’ingegneria di algoritmi euristici e alle previsioni meteorologiche basate sulla fisica; quest’ultimo ambito è fuori distribuzione rispetto alle attività di selezione. In tutti e quattro, l’agente migliore individuato eguaglia o supera un agente di ricerca operativo progettato da esseri umani, che si colloca tra i migliori su FML-Bench. Anche su una famiglia di attività distinta e non utilizzata in fase di selezione, gli agenti individuati mostrano una riduzione del reward hacking, una proprietà che il ciclo non ha mai ottimizzato esplicitamente: nel corso della prova, il tasso scende dal 55% al 32%, 7 punti percentuali al di sotto di quello dell’agente progettato da esseri umani. Nel complesso, questi risultati mostrano che un agente di ricerca basato sull’IA può migliorare la propria efficienza di ricerca attraverso il miglioramento ricorsivo di sé e che i progressi si trasferiscono ad attività e ambiti mai incontrati dal ciclo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv