Ricerca
TraceDance: un sistema automatizzato per creare benchmark sui comportamenti degli agenti a partire dalle tracce del loro impiego in contesti reali
Un agente può portare a termine un compito e, durante l’esecuzione, manifestare comunque comportamenti indesiderati. Agli sviluppatori servono test per i comportamenti specifici riscontrati nell’impie

- arXiv
- 2609.33295
- Pubblicato
- 2026-09-27
- Autori
- Dehai Min, Daoan Zhang, Yiming Zeng, Huayi Zhang, Ziyi Chen, Yan Zhang, Qinbo Bai, Mengyuan Chao, Jing Ning, Qiyue Hua, Huiyi Chen, Hanrong Zhang, Henry Peng Zou, Jie Yang, Wei Xu, Philip S. Yu
Abstract degli autori
Un agente può portare a termine un compito e, durante l’esecuzione, manifestare comunque comportamenti indesiderati. Agli sviluppatori servono test per i comportamenti specifici riscontrati nell’impiego reale, oltre alle suite di benchmark fisse. Presentiamo TraceDance, un sistema di agenti che costruisce benchmark mirati a partire dalle tracce di impiego per comportamenti indesiderati indicati dall’utente. Per rendere efficiente la costruzione, Anchor-and-Confirm combina la ricerca programmabile con la conferma dei singoli candidati da parte di un modello linguistico di grandi dimensioni (LLM) Flash, mentre Anchor Synthesis Loop genera e rivede le specifiche per comportamenti personalizzati. I benchmark usano la continuazione da un punto decisionale registrato per valutare il turno successivo di un LLM secondo una griglia specifica per il comportamento, senza una risposta di riferimento né la riproduzione dell’ambiente. Gli esperimenti sulla programmazione e sull’uso generale degli strumenti si basano su 252.557 sessioni e producono 107 benchmark con 4.125 istanze, soddisfacendo il 95,3% delle richieste relative agli obiettivi di costruzione. Entrambi gli annotatori umani confermano la presenza del comportamento richiesto nell’84% delle istanze campionate, e il grado di accordo tra il valutatore automatico e i giudizi umani di superamento o mancato superamento è paragonabile a quello tra gli annotatori. Nove LLM di frontiera raggiungono un tasso medio di superamento di appena il 26,7%, segno che faticano ancora a rispondere in modo appropriato nei punti decisionali valutati. L’analisi trasversale dei benchmark specifici per comportamento rivela inoltre punti deboli nel modo in cui gli attuali LLM si comportano come agenti. Trasformando i problemi riscontrati nell’impiego reale in benchmark mirati, TraceDance potrebbe diventare una componente fondamentale del ciclo di automiglioramento ricorsivo (RSI).