Ricerca
LoopArena: un benchmark per i modelli come controllori in fase di esecuzione nell’ingegneria dei loop
L’ingegneria dei loop sta emergendo come pratica per organizzare il lavoro di sviluppo attorno agli agenti di programmazione. Anziché scrivere ogni prompt a mano, chi la adotta progetta loop che monit

- arXiv
- 2608.28281
- Pubblicato
- 2026-08-28
- Autori
- Yi Wang, Haopeng Zhang, Chengxiang Huang, Rui Dai, Kaikui Liu, Piotr Koniusz, Xiangxiang Chu
Abstract degli autori
L’ingegneria dei loop sta emergendo come pratica per organizzare il lavoro di sviluppo attorno agli agenti di programmazione. Anziché scrivere ogni prompt a mano, chi la adotta progetta loop che monitorano i progressi, assegnano il lavoro, eseguono verifiche e decidono che cosa debba fare l’agente in seguito. Anche con un agente di programmazione capace, un loop può fidarsi di una nota sui progressi ormai superata, saltare verifiche necessarie, impiegare il proprio budget nella direzione sbagliata o fermarsi prima che il compito possa essere consegnato in sicurezza. Eppure il risultato finale di una singola esecuzione dall’inizio alla fine non permette di stabilire se il successo o il fallimento dipenda dalle indicazioni del loop o dalla capacità dell’agente di programmazione di svolgere il compito. Presentiamo LoopArena, un benchmark per valutare quanto bene un modello sappia guidare un agente di programmazione distinto attraverso un compito di lunga durata. Il modello valutato è il \textbf{Controller}: dopo ogni ciclo di programmazione riceve un riepilogo strutturato dell’esecuzione e indica a un agente di programmazione distinto e fisso, il \textbf{Worker}, che cosa fare o verificare in seguito, oppure decide se fermarsi. LoopArena valuta questa capacità in tre contesti complementari, diversi per ampiezza dell’esecuzione e costo. Type I attribuisce un punteggio alla scelta del Loop Contract per il passo successivo tramite domande convalidate mediante esecuzione, senza eseguire il Worker durante la valutazione. Type II esegue un controllo ripetuto su una parte selezionata di un compito completo, mentre Type III valuta il corrispondente compito completo a partire dal suo stato originale. Sui compiti completi, il miglior Strict Success Rate osservato è \textbf{24.69\%}, il che lascia ampio margine di miglioramento nel controllo dei loop su orizzonti lunghi. Tra i Controller, la riduzione appaiata del costo di inferenza stimato è in media del \textbf{64.4\%}, e Type II produce un ordinamento simile secondo il criterio principale Core (coefficiente di Spearman \(ρ=\textbf{0.9747}\)). Rendiamo disponibili i dati del benchmark e il codice di valutazione all’indirizzo https://github.com/AMAP-ML/LoopArena .
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv