Vai al contenuto
AI.info

Ricerca

HybridCUA: imparare a coordinare GUI e CLI per gli agenti che usano il computer

Gli agenti che usano il computer (CUA) hanno dimostrato notevoli capacità nello svolgere attività digitali. Tuttavia, i CUA esistenti si affidano esclusivamente alle interazioni con l’interfaccia graf

HybridCUA: imparare a coordinare GUI e CLI per gli agenti che usano il computer
arXiv
2609.38008
Pubblicato
2026-09-29
Autori
Tongbo Chen, Junbo Niu, Zhengxi Lu, Niu Lian, Fei Tang, Yuchen Yan, Yike Hong, Yong Du, Yizhou Liu, Bofan Chen, Yongliang Shen

Abstract degli autori

Gli agenti che usano il computer (CUA) hanno dimostrato notevoli capacità nello svolgere attività digitali. Tuttavia, i CUA esistenti si affidano esclusivamente alle interazioni con l’interfaccia grafica (GUI), spesso inefficienti e soggette a errori, oppure le integrano con API o strumenti specifici per le singole applicazioni, che richiedono un notevole lavoro di sviluppo e sono difficili da estendere a più applicazioni. Sosteniamo che la prossima generazione di CUA dovrebbe combinare le interazioni con la GUI e quelle con l’interfaccia a riga di comando (CLI), sfruttando la versatilità della GUI e l’efficienza dei comandi di shell. Una difficoltà cruciale, però, è che i modelli attuali non sanno quando né come usare la CLI durante l’esecuzione di un’attività. Per affrontarla, abbiamo sviluppato una pipeline per la costruzione dei dati che produce tre tipi di traiettorie: solo GUI, solo CLI e traiettorie in cui GUI e CLI si alternano. Il risultato è HybridCUA-8K, che contiene 5K traiettorie ibride e 3K attività RLVR verificate. Su questi dati si basa un framework di addestramento in due fasi: un fine-tuning supervisionato sulle traiettorie costruite, seguito da un apprendimento per rinforzo con ricompense che tengono conto dell’uso della CLI e incoraggiano gli agenti a usarla in modo selettivo e affidabile. Gli esperimenti mostrano che HybridCUA-9B raggiunge un’accuratezza del 53,6% su OSWorld, con un miglioramento di 14,8 punti percentuali rispetto al modello di base, e migliora le prestazioni su WindowsAgentArena di 4,0 punti percentuali. Questi risultati dimostrano l’efficacia e la capacità di generalizzare tra piattaforme del paradigma ibrido GUI-CLI per gli agenti che usano il computer.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv