Vai al contenuto
AI.info

Ricerca

JarvisGUI: verso agenti GUI per più dispositivi con composizione dinamica delle attività

Nell’uso delle interfacce grafiche (GUI) nel mondo reale, i flussi di lavoro coinvolgono spesso più dispositivi e piattaforme e richiedono il trasferimento di risultati intermedi, il mantenimento di u

JarvisGUI: verso agenti GUI per più dispositivi con composizione dinamica delle attività
arXiv
2609.10451
Pubblicato
2026-09-09
Autori
Zixiang Chen, Yuheng Lu, Zihao Cheng, Zeming Liu, Jizeng Bai, Ziye Huang, Zhiyin Lin, Zihan Li, Yuhang Guo, Yunhong Wang, Haifeng Wang

Abstract degli autori

Nell’uso delle interfacce grafiche (GUI) nel mondo reale, i flussi di lavoro coinvolgono spesso più dispositivi e piattaforme e richiedono il trasferimento di risultati intermedi, il mantenimento di uno stato condiviso e il coordinamento tra ambienti eterogenei. Tuttavia, i benchmark GUI esistenti valutano in larga misura gli agenti su attività statiche che riguardano un singolo dispositivo, lasciando così sostanzialmente inesaminate le loro capacità di operare su più dispositivi e portando a una valutazione eccessivamente ottimistica della loro idoneità all’uso nel mondo reale. Presentiamo JarvisGUI, un benchmark dinamico che valuta gli agenti GUI su flussi di lavoro che coinvolgono più dispositivi e richiedono interazioni coordinate tra piattaforme eterogenee, tra cui Android, Windows e Ubuntu. Nello specifico, JarvisGUI formula le attività GUI come trasformazioni input-output nell’ambito di un sistema di tipi leggero, che consente di comporre automaticamente flussi di lavoro articolati in più passaggi e su più dispositivi e di valutare dinamicamente le prestazioni degli agenti in un quadro unificato. Valutando gli agenti in ambienti virtuali che comprendono più sistemi operativi, JarvisGUI rivela che gli agenti GUI open source allo stato dell’arte faticano a gestire la consapevolezza del trasferimento dello stato, il ragionamento contestuale tra piattaforme e la gestione delle dipendenze a lungo termine richiesti dai flussi di lavoro nel mondo reale, mettendo in luce una lacuna critica nelle capacità, invisibile ai benchmark esistenti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv