Vai al contenuto
AI.info

Ricerca

Da uno a molti, da molti a uno: addestramento iterativo di esperti consapevole delle categorie per agenti di ingegneria del software

L’ingegneria del software a livello di repository (SWE) comprende categorie di attività eterogenee, i cui progressi con l’apprendimento per rinforzo agentico aggregato possono essere disomogenei: i mi

Da uno a molti, da molti a uno: addestramento iterativo di esperti consapevole delle categorie per agenti di ingegneria del software
arXiv
2609.23377
Pubblicato
2026-09-20
Autori
Jie Zhao, Ziyu Jiang, Suhang Zheng, Minghui Shan, Xiaoxiao Xu, Lin Qu

Abstract degli autori

L’ingegneria del software a livello di repository (SWE) comprende categorie di attività eterogenee, i cui progressi con l’apprendimento per rinforzo agentico aggregato possono essere disomogenei: i miglioramenti in alcune categorie coincidono con regressi in altre, mentre i risultati complessivi nascondono questi cambiamenti. Motivati da questo andamento altalenante tra categorie, sviluppiamo un framework per l’addestramento di esperti consapevole delle categorie e l’integrazione delle policy. La costruzione di attività eseguibili e SWE Labeler, un sistema di etichettatura multi-asse basato su evidenze, organizzano gli insiemi di dati di addestramento. L’RL iniziale specifico per categoria migliora il successo medio in addestramento, ma lascia disomogenei i progressi a livello di singola istanza; questo motiva il consolidamento esplicito dei comportamenti efficaci e la selezione di attività adattiva alla policy. Esperti di categoria con la stessa origine alternano Agentic-miniRL a orizzonte lungo e Refresh-Repair-Expand (RRE): la policy aggiornata verifica nuovamente la padronanza delle istanze, riutilizza le proprie traiettorie riuscite e verificate per il Repair SFT e seleziona di nuovo le attività per un ulteriore RL. La distillazione on-policy multi-insegnante instradata tramite etichette (MOPD) consolida gli esperti in un unico modello studente distribuibile; l’estrapolazione del reward con gating ReLU mantiene solo la direzione di miglioramento di ciascun insegnante rispetto al riferimento. L’addestramento degli esperti e l’integrazione delle policy non richiedono modelli esterni che forniscano traiettorie di soluzione o obiettivi d’azione. Valutiamo Pooled RL e Balanced RL, lo sviluppo degli esperti e l’integrazione in un singolo modello considerando la risoluzione complessiva e per categoria, il miglioramento minimo per categoria rispetto a ciascun baseline di RL congiunto e il recupero dei guadagni degli esperti. La policy MOPD finale raggiunge una percentuale media di risoluzione del 58,04% su Pro-618 e del 59,00% su SWE-bench Multilingual, con un miglioramento rispetto al modello di base di 5,39 e 2,78 punti percentuali, rispettivamente.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv