Ricerca
Agent Error Dataset: 50.000 coppie errore--diagnosi su larga scala per l’analisi dei fallimenti e il post-training consapevole degli errori
L’esecuzione non riuscita di un agente basato su LLM contiene più informazioni della sola ricompensa finale: le osservazioni a disposizione dell’agente, le azioni che ha scelto e le risposte dell’ambi

- arXiv
- 2609.40111
- Pubblicato
- 2026-09-30
- Autori
- Kunlun Zhu, Xuyan Ye, Yibo Li, Cheng Qian, Beibin Li, Heng Ji
Abstract degli autori
L’esecuzione non riuscita di un agente basato su LLM contiene più informazioni della sola ricompensa finale: le osservazioni a disposizione dell’agente, le azioni che ha scelto e le risposte dell’ambiente. Per riutilizzare questa esperienza nell’apprendimento occorre individuare una decisione da rivedere e mettere alla prova un’alternativa concreta. Presentiamo Agent Error Dataset (AED), che comprende 50.228 coppie errore-diagnosi ricavate da 9.961 task di origine, in 33 ambienti, 19 famiglie di harness e 23 modelli di policy, nell’ambito di sistemi di agenti basati su testo. Conserviamo le tracce originali e i metadati di esecuzione per consentire l’analisi dei fallimenti in contesti diversi e nuove diagnosi senza ripetere l’esecuzione originale. La nostra pipeline Agentic Error-to-Training (AET), articolata in cinque fasi, raccoglie fallimenti reali, genera diagnosi e correzioni proposte e le verifica sulla base delle evidenze registrate. Dove è possibile ripetere l’esecuzione, confrontiamo le correzioni con nuovi tentativi che usano l’azione originale, partendo dallo stesso checkpoint e con impostazioni di esecuzione equivalenti. Costruiamo poi set di dati distinti per l’addestramento alla diagnosi e al recupero dell’agente. Su 3.062 coppie di esecuzioni ripetute in condizioni equivalenti, le correzioni proposte al primo tentativo portano il tasso di superamento della verifica dal 18,4% al 51,1%, con un aumento di 32,7 punti percentuali. Usando una versione delle diagnosi congelata separatamente, il fine-tuning sulle diagnosi complete relative a 1.656 task di origine porta la concordanza di Qwen3-8B sul passaggio esatto rispetto alle etichette interne del teacher dal 47,2% al 63,6%, in media su tre seed e su un campione di 943 casi tenuto da parte. Il riferimento migliore tra quelli che usano prompt ottiene il 54,7% in questo confronto, e la concordanza media migliora a ciascuna delle quattro dimensioni crescenti del set di addestramento. In un confronto tra strategie di addestramento dell’agente condotto con un solo seed, l’addestramento alla correzione basato solo sulle azioni ottiene su WebShop-lite un punteggio superiore di 6,67 punti percentuali rispetto all’addestramento basato solo sui successi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv