Ricerca
JarvisGUI: verso agenti GUI per più dispositivi con composizione dinamica delle attività
Nell’uso delle interfacce grafiche (GUI) nel mondo reale, i flussi di lavoro coinvolgono spesso più dispositivi e piattaforme e richiedono il trasferimento di risultati intermedi, il mantenimento di u

- arXiv
- 2609.10451
- Pubblicato
- 2026-09-09
- Autori
- Zixiang Chen, Yuheng Lu, Zihao Cheng, Zeming Liu, Jizeng Bai, Ziye Huang, Zhiyin Lin, Zihan Li, Yuhang Guo, Yunhong Wang, Haifeng Wang
Abstract degli autori
Nell’uso delle interfacce grafiche (GUI) nel mondo reale, i flussi di lavoro coinvolgono spesso più dispositivi e piattaforme e richiedono il trasferimento di risultati intermedi, il mantenimento di uno stato condiviso e il coordinamento tra ambienti eterogenei. Tuttavia, i benchmark GUI esistenti valutano in larga misura gli agenti su attività statiche che riguardano un singolo dispositivo, lasciando così sostanzialmente inesaminate le loro capacità di operare su più dispositivi e portando a una valutazione eccessivamente ottimistica della loro idoneità all’uso nel mondo reale. Presentiamo JarvisGUI, un benchmark dinamico che valuta gli agenti GUI su flussi di lavoro che coinvolgono più dispositivi e richiedono interazioni coordinate tra piattaforme eterogenee, tra cui Android, Windows e Ubuntu. Nello specifico, JarvisGUI formula le attività GUI come trasformazioni input-output nell’ambito di un sistema di tipi leggero, che consente di comporre automaticamente flussi di lavoro articolati in più passaggi e su più dispositivi e di valutare dinamicamente le prestazioni degli agenti in un quadro unificato. Valutando gli agenti in ambienti virtuali che comprendono più sistemi operativi, JarvisGUI rivela che gli agenti GUI open source allo stato dell’arte faticano a gestire la consapevolezza del trasferimento dello stato, il ragionamento contestuale tra piattaforme e la gestione delle dipendenze a lungo termine richiesti dai flussi di lavoro nel mondo reale, mettendo in luce una lacuna critica nelle capacità, invisibile ai benchmark esistenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv