Vai al contenuto
AI.info

Ricerca

CodeMidas: scalare gli ambienti di RL per la programmazione agentica a partire dal codice stesso

Addestrare agenti di programmazione capaci con l’apprendimento per rinforzo (RL) richiede compiti diversificati e verificatori affidabili. Le basi di codice open source offrono una ricca fonte di ques

CodeMidas: scalare gli ambienti di RL per la programmazione agentica a partire dal codice stesso
arXiv
2609.22068
Pubblicato
2026-09-18
Autori
Bowen Ye, Lei Li, Shicheng Li, Zihao Yue, Linghao Zhang, Hanglong Lv, Yuanxin Liu, Wenhan Ma, Hao Tian, Rang Li, Jinhao Dong, Yikai Zhao, Xiangwei Deng, Hailin Zhang, Liang Zhao, Qi Liu, Lingpeng Kong, Tong Yang, Fuli Luo

Abstract degli autori

Addestrare agenti di programmazione capaci con l’apprendimento per rinforzo (RL) richiede compiti diversificati e verificatori affidabili. Le basi di codice open source offrono una ricca fonte di questi compiti, mentre i metodi esistenti si basano in genere su artefatti dello sviluppo, come issue e commit, limitando la varietà dei compiti che si possono estrarre. Per ampliare gli ambienti di RL, presentiamo CodeMidas, una pipeline agentica che trasforma le funzionalità implementate nelle basi di codice esistenti in ambienti di RL eseguibili, usando il codice sorgente come unico input specifico per il compito. CodeMidas dedica risorse computazionali basate su agenti a ogni fase della costruzione degli ambienti: gli agenti esplorano le funzionalità implementate per formulare specifiche comportamentali, costruiscono test basati sull’esecuzione del codice originale e convalidano e filtrano i compiti candidati tramite controlli di esecuzione e ripetute esecuzioni delle soluzioni. Il dataset risultante comprende 5.545 compiti di addestramento ricavati da 3.185 basi di codice open source, che coprono 23 linguaggi di programmazione e 15 ambiti tecnici. L’addestramento di MiMo-V2.5 su questi compiti con GRPO migliora le prestazioni su tutti e cinque i benchmark, che coprono la correzione di issue (DeepSWE + 11,7%), la costruzione di programmi completi (ProgramBench +17%) e il lavoro da terminale (Terminal-Bench v2.1 +8,5%). Gli studi di ablazione mostrano che aumentare il numero di compiti di addestramento di alta qualità migliora le prestazioni. L’analisi delle traiettorie mostra che l’agente addestrato con RL adotta comportamenti migliori, come una maggiore esplorazione delle basi di codice e forme di autoverifica più diversificate. Questi risultati dimostrano che il codice sorgente è una base scalabile per costruire ambienti di RL che migliorano gli agenti di programmazione in una varietà di compiti software.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv