Ricerca
Argo-Bench: valutare gli agenti per i dati nei flussi di lavoro su scala aziendale
I flussi di lavoro reali di data science e analisi dei dati nelle aziende richiedono di ragionare su decine di tabelle, svolgere analisi statistiche e agire in base ai risultati. I benchmark consolida

- arXiv
- 2610.02122
- Pubblicato
- 2026-10-01
- Autori
- Gabriel Tomitsuka, Arman Raayatsanati, Emma Xing, Duke Gand, Joseph J Ma
Abstract degli autori
I flussi di lavoro reali di data science e analisi dei dati nelle aziende richiedono di ragionare su decine di tabelle, svolgere analisi statistiche e agire in base ai risultati. I benchmark consolidati di text-to-SQL valutano soltanto la generazione di query, e alcune verifiche hanno rilevato che le risposte considerate corrette sono spesso sbagliate. Poiché i data warehouse aziendali reali contengono dati troppo sensibili per essere resi pubblici, questi benchmark si basano su dataset pubblici in cui un evento aziendale è contenuto in un’unica tabella. Presentiamo Argo-Bench, un sistema di valutazione che comprende 210 attività di data science e analisi dei dati. Attingendo a dati pubblici, pubblicazioni di settore sottoposte a revisione paritaria e documenti depositati presso le autorità di regolamentazione, simuliamo una piattaforma di consegna di cibo a New York su scala reale, con 81 milioni di ordini nel 2024, parametri economici realistici, schemi di frode e incentivi del marketplace. Esportiamo questo ambiente simulato in un data warehouse ERP di 235 tabelle e 7,5 miliardi di righe, modellato sullo schema di Oracle E-Business Suite. Lo stato effettivo del simulatore non è disponibile nel data warehouse a cui accede l’agente: per svolgere le attività, l’agente deve quindi ricostruire i fatti esplorando il data warehouse prima di agire. Argo-Bench va oltre il text-to-SQL: l’agente dispone azioni come bloccare account fraudolenti, assegnare budget agli incentivi per i corrieri o corrispondere retribuzioni arretrate, e il sistema di valutazione attribuisce un punteggio a ciascuna azione in base alle sue conseguenze nel simulatore. Per ogni attività esiste una soluzione di riferimento eseguibile che dimostra come sia possibile risolverla usando soltanto il data warehouse. Il migliore tra 14 modelli di frontiera e a pesi aperti ottiene un punteggio pari o superiore a 95 soltanto nel 34,8% delle attività, con una media di 59,5 punti. Ci auguriamo che Argo-Bench contribuisca allo sviluppo di agenti capaci di comprendere gli ambienti di dati reali, orientarsi al loro interno e agire in essi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv