Ricerca
AutoGUIWorld: generatori di immagini come modelli visivi del mondo per agenti GUI
Gli agenti GUI hanno bisogno di traiettorie di interazione di alta qualità per imparare come gli ambienti software rispondono alle azioni, mantengono il proprio stato e supportano flussi di lavoro in

- arXiv
- 2610.01215
- Pubblicato
- 2026-10-01
- Autori
- Cheng Yang, Yifan Wu, Yutao Huang, Zhaohua Zhang, Beiduo Chen, Muxi Chen, Chenchen Zhao, Hexuan Deng, Haolin Yang, Geyuan Zhu, Sa Zhu, Jianhuan Zhuo, Qiuyong Xiao, Jianhao Ruan, Yiran Peng, Jiayi Zhang, Tian Ye, Xinlei Yu, Tianwen Jiang, Jihong Zhang, Yuyu Luo
Abstract degli autori
Gli agenti GUI hanno bisogno di traiettorie di interazione di alta qualità per imparare come gli ambienti software rispondono alle azioni, mantengono il proprio stato e supportano flussi di lavoro in più passaggi. La varietà delle traiettorie disponibili, tuttavia, è limitata dalle applicazioni, dagli stati delle interfacce e dai flussi di lavoro accessibili negli ambienti sottostanti. Per ampliare questa copertura occorre predisporre software sempre più diversificati e complessi; le applicazioni specializzate comportano inoltre costi aggiuntivi di installazione, configurazione ed esecuzione. Presentiamo AutoGUIWorld, un framework per la generazione di dati che combina le conoscenze visive pregresse dei generatori di immagini con le conoscenze sui compiti di un pianificatore, per sintetizzare traiettorie di interazione con le GUI senza predisporre né eseguire i corrispondenti ambienti software. AutoGUIWorld campiona scene GUI iniziali a partire da specifiche strutturate del contesto del sistema operativo, dell’aspetto visivo e dello stato dell’interfaccia, e genera compiti in funzione di tali scene. Un pianificatore specifica quindi le azioni atomiche e le conseguenze visive previste, mentre un generatore di immagini modifica iterativamente la schermata corrente per produrre le osservazioni successive. L’ancoraggio delle azioni e il filtraggio della qualità a livello di transizione producono 79.266 esempi di addestramento a livello di singolo passaggio, con annotazioni spaziali, su Ubuntu, Windows, macOS e Chrome. Il fine-tuning di Qwen3.5-35B-A3B sulle traiettorie di AutoGUIWorld porta il punteggio medio nei compiti di OSWorld dal 33,0% al 40,8% e il tasso di successo nei compiti di ScienceBoard dal 14,0% al 32,2%. Questi risultati mostrano che le traiettorie generate migliorano le prestazioni degli agenti GUI in compiti reali su desktop e in ambito scientifico.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv