Vai al contenuto
AI.info

Ricerca

UndoBench: distinguere la competenza nello svolgimento dei compiti dalla capacità di recupero negli agenti di IA che usano strumenti

Gli agenti di IA che usano strumenti vengono impiegati sempre più spesso nei sistemi software aziendali. Eppure, i benchmark più diffusi valutano soprattutto il completamento dei compiti in condizioni

UndoBench: distinguere la competenza nello svolgimento dei compiti dalla capacità di recupero negli agenti di IA che usano strumenti
arXiv
2610.05622
Pubblicato
2026-10-04
Autori
Dolly Sah, Tanmay Sah, Harshul Jain, Tanya Sah

Abstract degli autori

Gli agenti di IA che usano strumenti vengono impiegati sempre più spesso nei sistemi software aziendali. Eppure, i benchmark più diffusi valutano soprattutto il completamento dei compiti in condizioni normali, confondendo la competenza di pianificazione di base con la capacità di recuperare dagli errori operativi. Presentiamo UndoBench, un benchmark che comprende 36 workflow di base e 36 scenari di errore in 8 ambiti aziendali. UndoBench distingue la competenza nello svolgimento dei compiti dalla capacità di recupero attraverso prove controfattuali appaiate con seed identici e oracoli che verificano la cronologia degli effetti a livello di protocollo e lo stato dell’ambiente. Nello studio a configurazione fissa sulla perdita della conferma di ricezione, condotto su 12 workflow TEST tenuti da parte, due modelli a pesi aperti, due framework e tre paradigmi di recupero (5.760 esecuzioni / 2.880 prove appaiate), la competenza in condizioni normali ha raggiunto l’83,54%, mentre il tasso di successo condizionato del recupero (CRSR) è sceso al 46,72%. Il semplice tentativo di ripetere l’operazione ha prodotto effetti esterni duplicati nel 53,33% delle prove. Le estensioni ai modelli accessibili tramite API commerciali hanno confermato questa separazione tra competenza e capacità di recupero. Le valutazioni condotte in diverse fasi dell’esecuzione mostrano che il recupero dipende dalla fase: prima della modifica, i metodi ottengono risultati simili, senza effetti duplicati nelle prove in cui l’agente dimostra di saper svolgere il compito; durante una modifica parziale, il semplice tentativo di ripetere l’operazione, l’idempotenza per singola chiamata e il journaling senza privilegi falliscono nei workflow compositi valutati; dopo il commit ma prima della conferma di ricezione, la verifica e l’idempotenza lato server migliorano notevolmente la sicurezza. Questi risultati mostrano che valutare soltanto il completamento dei compiti in condizioni normali nasconde vulnerabilità critiche nel recupero degli agenti autonomi, diverse a seconda della fase.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv