Vai al contenuto
AI.info

Ricerca

OSWorld-Pro: valutazione basata sui processi per gli agenti che usano il computer

La valutazione degli agenti che usano il computer (CUA) si limita spesso ai risultati finali che producono (al termine di centinaia di passaggi) e viene condotta con verificatori funzionali, come in O

OSWorld-Pro: valutazione basata sui processi per gli agenti che usano il computer
arXiv
2609.24890
Pubblicato
2026-09-21
Autori
Zhilin Wang, Shaokun Zhang, Yifan Zhang, Hao Zhang, Jin Xu, Binfeng Xu, Jian Hu, Yunheng Zou, Karan Sapra, Andrew Tao, Jan Kautz, Yi Dong

Abstract degli autori

La valutazione degli agenti che usano il computer (CUA) si limita spesso ai risultati finali che producono (al termine di centinaia di passaggi) e viene condotta con verificatori funzionali, come in OSWorld. Tuttavia, questo tipo di valutazione delle prestazioni finali non rende trasparente come e perché gli agenti falliscano nei diversi compiti, celando informazioni cruciali per i successivi miglioramenti. Per esempio, gli agenti che sbagliano nell’inserimento di dati tramite tastiera richiederebbero una strategia di mitigazione diversa da quelli che non riescono a impartire con precisione comandi basati sui clic nell’interfaccia grafica. Presentiamo OSWorld-Pro: un insieme di oltre 300 compiti con oltre 2.800 sotto-obiettivi, che consente la valutazione procedurale dei CUA sulla base di oltre 67.000 annotazioni umane. Usiamo giudici LLM robusti e allineati al giudizio umano per valutare il raggiungimento dei sotto-obiettivi di OSWorld-Pro e rivelare così i progressi compiuti dai modelli nel corso di una serie di sotto-obiettivi sequenziali e interdipendenti. I nostri risultati mostrano che OSWorld-Pro è impegnativo anche per gli LLM più avanzati: i modelli migliori, come Claude Opus 5, raggiungono appena il 75,7%, contro l’83,4% su OSWorld. Inoltre, individuiamo modalità di errore critiche, incentrate sul processo, in diversi modelli (per esempio, azioni non pertinenti ai sotto-obiettivi ed errori basati sui clic), fornendo indicazioni per migliorare le prestazioni e l’efficienza dei CUA.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv