Ricerca
SWE-Bench Pro Verified: un benchmark affidabile per gli agenti di ingegneria del software
SWE-Bench Pro si è affermato come benchmark di riferimento per valutare gli agenti di ingegneria del software su compiti impegnativi a livello di repository. Tuttavia, la nostra analisi mostra che l’a

- arXiv
- 2609.08149
- Pubblicato
- 2026-09-08
- Autori
- Pujun Zheng, Zixin Shang, Shufan Jiang, Wenhui Tian, Dongsheng Zhu, Zerun Ma, Dingbo Yuan, Qi Zhang
Abstract degli autori
SWE-Bench Pro si è affermato come benchmark di riferimento per valutare gli agenti di ingegneria del software su compiti impegnativi a livello di repository. Tuttavia, la nostra analisi mostra che l’affidabilità della sua valutazione è compromessa da due fattori: il reward hacking, reso possibile dalla diffusione delle soluzioni di riferimento o di informazioni nascoste sulla valutazione, e i problemi di qualità dei compiti, tra cui descrizioni fuorvianti dei problemi e test il cui ambito è definito in modo improprio. Questi problemi possono gonfiare i risultati nel benchmark e nascondere le effettive capacità di programmazione degli agenti. Presentiamo SWE-Bench Pro Verified, una versione verificata di SWE-Bench Pro che affronta entrambi i problemi. Il nostro approccio combina misure contro il reward hacking, che eliminano le principali vie di diffusione delle informazioni senza compromettere il normale funzionamento degli agenti, con una revisione dei compiti che corregge con interventi minimi le incongruenze nei casi problematici. Le valutazioni su SWE-Bench Pro Verified rivelano che alcuni modelli ottengono risultati sensibilmente peggiori rispetto alle valutazioni precedenti, suggerendo che i risultati finora ottenuti su SWE-Bench Pro potrebbero sovrastimare le reali capacità di ingegneria del software. SWE-Bench Pro Verified offre un benchmark più affidabile per valutare gli agenti di ingegneria del software.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv