Ricerca
RecreationWorld: ambienti scalabili e verificabili per agenti ibridi per l’uso del computer
Gli agenti per l’uso del computer (CUA) si sono sviluppati lungo due percorsi distinti: l’interazione grafica e lo sviluppo software tramite codice e riga di comando. Il lavoro digitale reale richiede

- arXiv
- 2609.22000
- Pubblicato
- 2026-09-18
- Autori
- Shuai Bai, Jiayong Deng, Yikun Fu, Chang Gao, Xuhao Hu, Mianqiu Huang, Yizhen Jiang, Yuheng Jing, Dehui Kong, Keliang Li, Ning Li, Wanli Li, Dayiheng Liu, Dunjie Lu, Changwei Luo, Que Shen, Zheyuan Wang, Zijian Wang, Jie Wu, Gao Wu, Zhihui Xie, Rui Xie, Haiyang Xu, An Yang, Jiakang Yuan, Yanming Zhang, Jiajun Zhang, Xi Zhang, Zhenru Zhang, Zhuo Zhen, Mingkang Zhu, Bowen Zhou
Abstract degli autori
Gli agenti per l’uso del computer (CUA) si sono sviluppati lungo due percorsi distinti: l’interazione grafica e lo sviluppo software tramite codice e riga di comando. Il lavoro digitale reale richiede entrambi, intrecciati tra loro anziché disposti in sequenza dall’inizio alla fine. Studiamo CUA ibridi che decidono autonomamente quando esplorare un’interfaccia, sviluppare software ed eseguire e verificare visivamente i propri artefatti. Presentiamo RecreationWorld, un framework per cinque piattaforme basato sulla ricostruzione: partendo da un’applicazione di riferimento in esecuzione, un agente deve scoprirne il comportamento e realizzare un’implementazione fedele, senza che venga prescritto un flusso di lavoro. RecreationWorld mette a disposizione ambienti riproducibili su Ubuntu, macOS, Windows, Android e Web, oltre a un harness unificato con controllo nativo dell’interfaccia grafica e strumenti di programmazione. L’applicazione di riferimento in esecuzione funge da oracolo per test comportamentali nascosti e fornisce ricompense basate sull’esecuzione. Ampliamo la generazione di traiettorie usando applicazioni open source di alta qualità. I modelli addestrati su queste traiettorie migliorano in cinque benchmark di programmazione e di uso ibrido del computer fuori distribuzione e verificano più spesso i risultati renderizzati, fornendo evidenze di trasferimento oltre la ricostruzione. Per la valutazione su compiti esclusi dall’addestramento, presentiamo RecreationBench, che comprende 250 compiti diversificati in vari ambiti e piattaforme. Asserzioni programmatiche e visive basate sulle applicazioni di riferimento coprono risultati condizionati dalle azioni a diversi livelli di profondità dell’interazione; ciascuna viene convalidata sull’applicazione di riferimento e da revisori umani prima che la suite venga congelata per la valutazione automatica. GPT-6 Astra è in testa con il 58,1% complessivo, ma supera tutti i test programmatici soltanto nel 2,8% dei compiti. Gli agenti riproducono la struttura statica delle interfacce con maggiore affidabilità rispetto alle interazioni e agli output calcolati, mentre le applicazioni generate restano più piccole e monolitiche delle applicazioni di riferimento. Rilasciamo il benchmark, gli ambienti e le suite di test.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv