Vai al contenuto
AI.info

Ricerca

RealSWE: una valutazione composizionale degli agenti di programmazione alle prese con richieste realistiche degli utenti

Gli agenti di programmazione vengono ormai valutati comunemente sulla famiglia di benchmark SWE-bench, i cui compiti sono costruiti a partire da issue di GitHub selezionate: lunghe, strutturate e ricc

RealSWE: una valutazione composizionale degli agenti di programmazione alle prese con richieste realistiche degli utenti
arXiv
2608.27831
Pubblicato
2026-08-28
Autori
Gyuhyeong Kim, Hyojung Gwon, Jeonghyeon Kim, Kyuhong Shim, Sunjae Lee

Abstract degli autori

Gli agenti di programmazione vengono ormai valutati comunemente sulla famiglia di benchmark SWE-bench, i cui compiti sono costruiti a partire da issue di GitHub selezionate: lunghe, strutturate e ricche di informazioni. Le richieste degli utenti reali, però, sono in genere molto più brevi e meno strutturate. Per caratterizzare questa differenza, definiamo una tassonomia delle informazioni articolata in sei categorie e quattro dimensioni dello stile linguistico, e le applichiamo ai prompt di utenti reali tratti da SWE-chat e alle descrizioni dei problemi di SWE-bench Verified e Pro. Rileviamo che le richieste contenenti soltanto una descrizione del problema, da sola o accompagnata da un contesto aggiuntivo limitato, rappresentano l’88% dei prompt reali ma appena il 7% dei problemi dei benchmark. Inoltre, l’87% dei prompt reali è scritto in modo informale, mentre il 94% dei problemi dei benchmark è formale. Sulla base di queste osservazioni, presentiamo RealSWE, 381 famiglie di compiti con più varianti derivate da SWE-bench Verified e Pro. Le varianti di ciascuna famiglia condividono lo stesso compito sottostante e la stessa patch di riferimento, ma differiscono per la composizione delle informazioni e lo stile linguistico. Valutando sette LLM attuali con RealSWE, rileviamo che i) gli input realistici riducono i tassi di risoluzione in media di 6,4 punti percentuali e possono cambiare la classifica dei modelli. Un’analisi controllata mostra inoltre che ii) includere il comportamento desiderato e la motivazione incide significativamente sulle prestazioni, mentre le informazioni sull’ambiente e i passaggi per la riproduzione aggiungono soltanto token, senza benefici misurabili; iii) lo stile linguistico ha effetti solo modesti, che variano a seconda del modello. Questi risultati offrono indicazioni pratiche agli utenti e agli agenti: specificare esplicitamente il comportamento desiderato e la motivazione, che la maggior parte dei prompt reali omette, migliora notevolmente le prestazioni degli LLM nell’ingegneria del software.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv