Vai al contenuto
AI.info

Ricerca

$τ^τ$-Bench: un ambiente per la costruzione realistica di agenti end-to-end

Gli agenti basati su LLM stanno rapidamente diventando software impiegati in produzione per gestire il servizio clienti, dirimere controversie e operare sistemi interni. In particolare, la loro realiz

$τ^τ$-Bench: un ambiente per la costruzione realistica di agenti end-to-end
arXiv
2609.04611
Pubblicato
2026-09-04
Autori
Quan Shi, Keshav Dhandhania, Karthik Narasimhan, Victor Barres

Abstract degli autori

Gli agenti basati su LLM stanno rapidamente diventando software impiegati in produzione per gestire il servizio clienti, dirimere controversie e operare sistemi interni. In particolare, la loro realizzazione viene affidata sempre più spesso ad agenti di programmazione, eppure i benchmark esistenti dicono poco sulla capacità di un sistema di IA di consegnarne uno nelle condizioni di un vero incarico per un cliente. Presentiamo $τ^τ$-bench (si pronuncia hyper-tau-bench), un benchmark in cui il compito è costruire un agente. A un agente sviluppatore vengono forniti i dati che un’azienda conserva realmente, un cliente che conosce i requisiti, un’API di produzione attraverso cui devono passare le operazioni, una base di codice da ereditare e vincoli sui costi di erogazione del servizio e sui modelli: lo stesso punto di partenza di un incarico reale. A partire da questi elementi, deve consegnare un agente completo per il servizio clienti, valutato mettendolo alla prova con utenti simulati riservati alla valutazione. Su 53 compiti in quattro ambiti, la configurazione più efficace, Claude Opus 5 con Claude Code, supera appena il 23,9% delle simulazioni di valutazione. Il limite superiore di riferimento realizzato da esperti, invece, ottiene l’82,2%. Gli insuccessi rispecchiano quelli osservati dagli sviluppatori di agenti: i modelli si limitano a interrogazioni superficiali anziché comprendere a fondo i dati, comunicano pochissimo con il cliente e sperimentano troppo poco con l’architettura dell’agente e la spesa per l’erogazione del servizio, consegnando il primo progetto che funziona. Vogliamo che $τ^τ$-bench renda il lavoro di costruzione collaborativa degli agenti un obiettivo misurabile per gli agenti di programmazione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv