Vai al contenuto
AI.info

The Pulse

OSWorld-Pro individua i fallimenti degli agenti che usano il computer prima del traguardo

Un nuovo benchmark su arXiv valuta gli agenti che usano il computer attraverso la sequenza di azioni che porta a un risultato, mettendo in luce fallimenti che la valutazione dello stato finale può nascondere.

OSWorld-Pro individua i fallimenti degli agenti che usano il computer prima del traguardo

AI.info Team ·

Gli agenti che usano il computer possono ricevere lo stesso punteggio negativo sia che si blocchino al primo clic, sia che commettano un errore verso la fine di un lungo flusso di lavoro. Un nuovo benchmark, chiamato OSWorld-Pro, è stato progettato per mostrare questa differenza.

Il paper, OSWorld-Pro: Process-based Evaluation for Computer Use Agents, è stato inviato ad arXiv il 21 settembre 2026. Tra gli autori figurano Zhilin Wang, Shaokun Zhang, Yifan Zhang e altri nove. Il lavoro esamina le prestazioni degli agenti che usano il computer lungo una sequenza di azioni, invece di giudicare soltanto il file finale o lo stato dell’applicazione.

«La valutazione degli agenti che usano il computer (CUA) si limita spesso ai risultati che producono (al termine di centinaia di passaggi) e si basa su verificatori funzionali, come avviene in OSWorld.»

Zhilin Wang, Shaokun Zhang, Yifan Zhang e nove coautori, autori del paper

Perché il risultato finale può nascondere un fallimento

OSWorld-Pro è presentato come una valutazione procedurale per gli agenti che usano il computer. Comprende più di 300 attività e oltre 2.800 sotto-obiettivi, supportati da oltre 67.000 annotazioni umane. I sotto-obiettivi dipendono l’uno dall’altro in sequenza, consentendo al benchmark di monitorare i progressi compiuti da un agente durante un’attività, anziché registrare soltanto se alla fine raggiunge lo stato desiderato.

Questa struttura permette di distinguere diversi tipi di fallimento. Un agente che commette un errore nell’inserimento da tastiera potrebbe aver bisogno di una soluzione diversa rispetto a uno che non riesce a fare clic con precisione su un’interfaccia grafica. Un punteggio basato sullo stato finale può nascondere questa distinzione quando entrambi i sistemi non riescono a produrre il risultato richiesto.

Il benchmark usa valutatori basati su modelli linguistici di grandi dimensioni, allineati alle valutazioni umane, per verificare se gli agenti raggiungono i singoli sotto-obiettivi. In questo modo i ricercatori possono esaminare in quale punto di un flusso di lavoro un agente perde terreno e quali azioni sembrano collegate al fallimento.

Una prova più difficile per i sistemi che usano il computer

Secondo il paper, OSWorld-Pro è impegnativo anche per i modelli linguistici di grandi dimensioni più avanzati. Il suo abstract riporta che Claude Opus 5 ottiene il 75,7% su OSWorld-Pro, rispetto all’83,4% su OSWorld. Il confronto suggerisce che gli agenti possono ottenere risultati peggiori quando la valutazione segue il processo con cui completano un’attività, anziché concentrarsi soltanto sul risultato finale.

OSWorld-Pro è descritto come un complemento di OSWorld, un contesto di valutazione incentrato sullo stato finale prodotto da un agente. Aggiungendo una valutazione a livello di sotto-obiettivo, il nuovo benchmark mira a fornire più informazioni sul comportamento di un sistema prima che raggiunga il risultato finale, o non riesca a raggiungerlo.

Modalità di fallimento incentrate sul processo

Gli autori individuano nelle azioni non pertinenti ai sotto-obiettivi e negli errori di clic due modalità di fallimento critiche. Queste categorie indicano problemi che potrebbero non emergere in una valutazione basata soltanto sul risultato. Un agente può continuare a eseguire azioni che, prese singolarmente, sembrano ragionevoli, pur non contribuendo più al sotto-obiettivo corrente.

Anche gli errori di clic possono modificare lo stato visibile di un’interfaccia grafica, portando l’agente a operare su una schermata o una selezione non desiderata. Quando un benchmark registra la sequenza di sotto-obiettivi e azioni, i ricercatori possono studiarne l’evoluzione, anziché considerare l’intero tentativo come un unico successo o fallimento.

OSWorld-Pro non sostituisce i test basati sul risultato finale. Aggiunge una prospettiva incentrata sul processo per valutare le prestazioni degli agenti che usano il computer, offrendo agli sviluppatori un modo per esaminare non solo se un agente ha completato un’attività, ma anche come sono cambiati i suoi progressi lungo il percorso.

Fonte

Esplora

Altri articoli