Vai al contenuto
AI.info

Ricerca

CUA-SWE: quando gli agenti che usano il computer incontrano l’ingegneria del software visiva

Lo sviluppo del software richiede più che modificare il codice: gli sviluppatori eseguono ripetutamente il software, interagiscono con le sue interfacce, ne osservano visivamente il comportamento e us

CUA-SWE: quando gli agenti che usano il computer incontrano l’ingegneria del software visiva
arXiv
2609.32600
Pubblicato
2026-09-26
Autori
Prince Zizhuang Wang, Chenhao Liang, Zelong Xu, Aojie Yuan, Xiaolin Zhou, Haiyue Zhang, Yue Zhao, Xiyang Hu, Shuli Jiang

Abstract degli autori

Lo sviluppo del software richiede più che modificare il codice: gli sviluppatori eseguono ripetutamente il software, interagiscono con le sue interfacce, ne osservano visivamente il comportamento e usano queste osservazioni per decidere che cosa cambiare e se una modifica funziona. Gli agenti di programmazione e quelli che usano il computer sono stati studiati perlopiù separatamente, lasciando poco esplorato questo processo di sviluppo integrato. Per diagnosticare un errore che si manifesta durante l’interazione con il software in esecuzione, gli agenti devono collegare le osservazioni visive al codice che ne è responsabile, quindi usare di nuovo l’applicazione per verificare la correzione. Presentiamo CUA-SWE, un benchmark, un ambiente e una pipeline di valutazione per l’ingegneria del software con l’uso del computer. Oltre a studiare come il feedback dell’interfaccia grafica contribuisca alla diagnosi e alla correzione, ci chiediamo se gli agenti riescano a completare compiti di ingegneria del software quando le specifiche o le informazioni operative necessarie sono disponibili soltanto attraverso l’interfaccia visiva dell’applicazione in esecuzione. CUA-SWE copre quattro ambiti dell’ingegneria del software e richiede agli agenti di modificare codice e configurazione, eseguire comandi, interagire con il software in esecuzione e osservare il feedback visivo nell’ambito dello stesso compito. Ogni compito comprende test deterministici specifici che verificano se il software risultante soddisfa i requisiti e preserva il comportamento specificato. La nostra valutazione descrive come gli agenti all’avanguardia combinano l’esecuzione a livello di codice sorgente con le schermate dell’applicazione e l’interazione grafica per produrre modifiche al software verificate. Esaminiamo le prestazioni nei diversi ambiti e in relazione ai requisiti informativi dei compiti, insieme ai comportamenti di sviluppo associati alle correzioni riuscite. CUA-SWE offre un ambiente di prova unificato per studiare come gli agenti usano il feedback visivo e l’interazione per guidare l’ingegneria del software, con criteri di correttezza eseguibili per il software risultante.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv