Ricerca
GUI-HARVEST: agenti GUI che si migliorano autonomamente attraverso l’evoluzione dell’harness guidata dalle evidenze
L’harness eseguibile in cui opera un modello GUI determina come vengono composte le osservazioni, eseguite le azioni e gestiti la verifica, il recupero e la terminazione. Rispetto all’ottimizzazione d

- arXiv
- 2610.00948
- Pubblicato
- 2026-10-01
- Autori
- Geyi Yang, Zikun Qu, Xiang Li, Zhiyong Wang, Min Zhang, Shipei Zeng, Zhongxiang Dai
Abstract degli autori
L’harness eseguibile in cui opera un modello GUI determina come vengono composte le osservazioni, eseguite le azioni e gestiti la verifica, il recupero e la terminazione. Rispetto all’ottimizzazione dell’harness per agenti non GUI, ottimizzarlo automaticamente presenta tre sfide collegate: conciliare le intenzioni del modello con gli effetti visivi osservati, diagnosticare i problemi quando gli esiti dell’esecuzione variano e individuare schemi ricorrenti di errore in compiti diversi per tradurli in modifiche riutilizzabili durante l’esecuzione. Presentiamo GUI-HARVEST, un sistema di ottimizzazione automatica dell’harness che consente agli agenti GUI di migliorarsi autonomamente mantenendo invariati i modelli di base. In primo luogo, per fondare la diagnosi sugli effetti osservati delle azioni, associa gli output del modello e le azioni eseguite alle schermate precedenti e successive, collegando i risultati a specifiche transizioni dell’interfaccia. In secondo luogo, per tenere conto della variabilità dell’esecuzione, considera le esecuzioni ripetute dello stesso compito come un’unica unità di evidenza e le confronta per individuare le differenze di comportamento rilevanti per l’esito. In terzo luogo, riunisce i risultati verificati su compiti diversi in schemi ricorrenti di errore, li traduce in modifiche circoscritte al codice sorgente, registrando le previsioni prima della valutazione, e verifica mediante esecuzioni ripetute sia gli effetti previsti sul comportamento sia le prestazioni nei compiti. Gli esperimenti su OSWorld-Verified mostrano miglioramenti costanti sui compiti tenuti da parte con sei modelli di base, tra modelli aperti generici, modelli aperti specializzati in GUI e modelli proprietari; Qwen3-VL-32B-Instruct guadagna 12,33 punti sull’intera suite. Il trasferimento dell’harness senza ulteriori modifiche migliora i risultati di GPT-5 di 13,87 punti percentuali su WindowsAgentArena con 50 passi, senza ulteriore ottimizzazione. A parità di modello di base e harness iniziale, GUI-HARVEST supera Self-Harness e Meta-Harness, suggerendo che diagnosi e validazione specifiche per le GUI aiutino i miglioramenti dell’harness a generalizzarsi a compiti mai incontrati. Il codice è disponibile all’indirizzo https://github.com/GaryYang12345/GUI-HARVEST.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv