Ricerca
RealSWE: una valutazione composizionale degli agenti di programmazione alle prese con richieste realistiche degli utenti
Gli agenti di programmazione vengono ormai valutati comunemente sulla famiglia di benchmark SWE-bench, i cui compiti sono costruiti a partire da issue di GitHub selezionate: lunghe, strutturate e ricc

- arXiv
- 2608.27831
- Pubblicato
- 2026-08-28
- Autori
- Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee
Abstract degli autori
Gli agenti di programmazione vengono ormai valutati comunemente sulla famiglia di benchmark SWE-bench, i cui compiti sono costruiti a partire da issue di GitHub selezionate: lunghe, strutturate e ricche di informazioni. Le richieste degli utenti reali, però, sono in genere molto più brevi e meno strutturate. Per caratterizzare questa differenza, definiamo una tassonomia delle informazioni articolata in sei categorie e quattro dimensioni dello stile linguistico, e le applichiamo ai prompt di utenti reali tratti da SWE-chat e alle descrizioni dei problemi di SWE-bench Verified e Pro. Rileviamo che le richieste contenenti soltanto una descrizione del problema, da sola o accompagnata da un contesto aggiuntivo limitato, rappresentano l’88% dei prompt reali ma appena il 7% dei problemi dei benchmark. Inoltre, l’87% dei prompt reali è scritto in modo informale, mentre il 94% dei problemi dei benchmark è formale. Sulla base di queste osservazioni, presentiamo RealSWE, 381 famiglie di compiti con più varianti derivate da SWE-bench Verified e Pro. Le varianti di ciascuna famiglia condividono lo stesso compito sottostante e la stessa patch di riferimento, ma differiscono per la composizione delle informazioni e lo stile linguistico. Valutando sette LLM attuali con RealSWE, rileviamo che i) gli input realistici riducono i tassi di risoluzione in media di 6,4 punti percentuali e possono cambiare la classifica dei modelli. Un’analisi controllata mostra inoltre che ii) includere il comportamento desiderato e la motivazione incide significativamente sulle prestazioni, mentre le informazioni sull’ambiente e i passaggi per la riproduzione aggiungono soltanto token, senza benefici misurabili; iii) lo stile linguistico ha effetti solo modesti, che variano a seconda del modello. Questi risultati offrono indicazioni pratiche agli utenti e agli agenti: specificare esplicitamente il comportamento desiderato e la motivazione, che la maggior parte dei prompt reali omette, migliora notevolmente le prestazioni degli LLM nell’ingegneria del software.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv