Ricerca
Repo-To-Skill: dai repository GitHub alle skill AI4AI
Gli agenti autonomi stanno iniziando a svolgere ricerche di apprendimento automatico (ML) dall’inizio alla fine. Questi agenti combinano un modello di base con un’infrastruttura per la pianificazione,

- arXiv
- 2609.02749
- Pubblicato
- 2026-09-02
- Autori
- Jianlyu Chen, Yuyang Hu, Hongjin Qian, Jiawei Liu, Wenqing Wei, Xiaolong Chen, Defu Lian, Zhicheng Dou, Chaozhuo Li, Qiwei Ye, Zheng Liu
Abstract degli autori
Gli agenti autonomi stanno iniziando a svolgere ricerche di apprendimento automatico (ML) dall’inizio alla fine. Questi agenti combinano un modello di base con un’infrastruttura per la pianificazione, l’esecuzione, la memoria e la verifica, ma questa architettura lascia ancora fuori dall’agente le conoscenze pratiche specifiche del settore. Chiamiamo questo livello mancante conoscenza operativa: il sapere che distingue il conoscere un metodo dal riuscire a farlo funzionare. Non è una conoscenza assente dal settore. Si trova nei repository e negli articoli scientifici, ma in forme pensate per lettori umani e troppo voluminose per essere caricate durante un compito. Una volta distillata in skill compatte e verificate, può essere riutilizzata in compiti diversi, anziché riscoperta a ogni esecuzione. Presentiamo DisCo, un agente di ricerca che crea skill e le usa durante la ricerca. La distillazione avviene in due forme complementari: indipendente dal compito, che condensa in skill riutilizzabili il contenuto dei repository ampiamente utilizzati nel settore, e orientata al compito, che produce le skill richieste da un compito concreto. La prima, applicata all’intero ecosistema aperto, dà origine alla AREX-Skill Library, con oltre 5.000 skill verificate, distillate da 1.000 repository di ML ampiamente utilizzati e organizzate in 20 ambiti e 178 famiglie di capacità. A parità di modello di base GPT-5.5, infrastruttura di ricerca e budget di esecuzione nelle fasi successive, l’agente di ricerca dotato di skill ottiene punteggi superiori del 134,3% su MLE-bench, del 34,4% su PaperBench, del 9,2% su FrontierCS e del 14,0% su PassNet rispetto allo stesso agente senza skill. Questi miglioramenti derivano dall’aggiunta di un contesto operativo distillato, a parità delle altre condizioni.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv