Vai al contenuto
AI.info

The Pulse

Argo-Bench rileva che gli agenti per l’analisi dei dati mancano l’obiettivo decisionale, non solo quello SQL

Argo-Bench valuta se gli agenti di IA sanno esaminare un data warehouse simulato su scala aziendale e prendere decisioni, anziché limitarsi a generare SQL. I risultati mostrano che i modelli possono analizzare i dati e tuttavia mancare l’ob

Argo-Bench rileva che gli agenti per l’analisi dei dati mancano l’obiettivo decisionale, non solo quello SQL

AI.info Team ·

Lo studio di TextQL del 1° ottobre mette alla prova gli agenti oltre SQL

I ricercatori di TextQL hanno presentato Argo-Bench su arXiv il 1° ottobre, descrivendolo come un benchmark per verificare se gli agenti di IA sappiano prendere decisioni aziendali dopo aver esaminato il database di una grande impresa. I suoi 210 compiti chiedono agli agenti più che restituire una query: devono analizzare i dati e registrare decisioni, per esempio bloccare account, assegnare incentivi ai corrieri o versare arretrati retributivi.

Il benchmark simula una piattaforma di consegna di cibo a New York con 81 milioni di ordini nel 2024. Lo studio descrive il data warehouse usato nei test come composto da 235 tabelle e 7,5 miliardi di righe, modellato su Oracle E-Business Suite. Il data warehouse pubblico, rilasciato separatamente, contiene 7,54 miliardi di righe; secondo lo studio, l’ambiente di test privato ne contiene 7,49 miliardi. I compiti riguardano frodi, operazioni della piattaforma, pianificazione finanziaria, contabilità e crescita.

Gli agenti agiscono sulla base di fatti assenti dal data warehouse

Il simulatore mantiene lo stato reale degli eventi separato dal data warehouse esaminato dagli agenti. Un modello deve quindi ricostruire ciò che è accaduto seguendo le informazioni attraverso le tabelle prima di registrare un’azione. I sistemi di valutazione confrontano queste azioni con lo stato nascosto del simulatore, anziché giudicare soltanto la risposta scritta dell’agente. Ogni compito ha anche una soluzione di riferimento eseguibile che mostra come risolverlo usando il data warehouse.

I compiti comprendono azioni, previsioni, budget, dati dichiarati e fonti di dati per dashboard. In 99 compiti, gli agenti ricevono soltanto una visione parziale dell’anno. Secondo lo studio, queste visioni parziali sono usate soprattutto, ma non esclusivamente, per le previsioni; i risultati previsionali riportati riguardano 72 compiti. Ogni agente ha operato in una sandbox con strumenti Python e senza accesso a Internet in uscita.

Claude Opus 5.5 è primo nel test dei modelli

Tra 14 modelli all’avanguardia e a pesi aperti, Claude Opus 5.5 ha ottenuto il miglior risultato complessivo, con una media di 59,5 su 100. Ha raggiunto almeno 95 — la soglia fissata dallo studio per considerare risolto un compito — nel 34,8% dei compiti. Gli intervalli di confidenza al 95% della Tabella 9 si estendono fino a 9,3 punti sopra la stima di un punteggio e fino a 8,5 punti percentuali sopra la stima della quota di compiti risolti; gli intervalli riflettono la scelta dei compiti, non la variabilità tra un’esecuzione e l’altra.

Un compito sui bonus ai corrieri mostra come gli agenti possano analizzare attentamente i dati e tuttavia mancare l’obiettivo aziendale. Gli autori dello studio — Gabriel Tomitsuka, Arman Raayatsanati, Emma Xing, Duke Gand e Joseph J Ma — scrivono:

«La piattaforma paga i bonus legati agli obiettivi per evitare maggiorazioni dei compensi nei periodi di picco; tuttavia, secondo il modello di risposta del simulatore, il piano comporta una perdita di 86.281 dollari, mentre un taglio uniforme farebbe risparmiare 0,40 milioni di dollari, e ottiene un punteggio di 0».

GPT-6 Astra ha individuato dove i bonus erano stati trattenuti in modo casuale e ha stimato come reagiva l’offerta di corrieri, ma i tagli proposti hanno causato una perdita di 86.281 dollari secondo il modello di risposta del simulatore. Claude Opus 5.5 ha invece tenuto conto del ruolo dei bonus nel sostituire le maggiorazioni dei compensi nei periodi di picco e ha risparmiato 3,09 milioni di dollari sui 3,12 milioni di dollari possibili. Nelle previsioni, gli intervalli nominali all’80% contenevano il valore poi osservato soltanto nel 44,8% delle 4.553 serie previsionali relative a 72 compiti.

Il benchmark misura una simulazione, non un’azienda reale

Argo-Bench non permette di prevedere direttamente le prestazioni sul data warehouse di un’azienda. Lo studio afferma che la simulazione copre una sola città e un solo anno e supporta un solo formato ERP. Individua inoltre ipotesi con basi poco solide nel programma di adesione simulato e avverte che la calibrazione rispetto a obiettivi aggregati non garantisce che i casi limite siano realistici. Gli autori affermano che il benchmark confronta gli agenti per l’analisi dei dati, anziché stimare come si comporterebbero in un’azienda reale.

Il data warehouse pubblico usa un seed del simulatore diverso da quello dell’ambiente privato usato per la valutazione ufficiale, quindi le entità e le soluzioni differiscono. I ricercatori possono scaricare il data warehouse da Hugging Face con licenza CC BY 4.0. Il repository GitHub mette a disposizione i compiti, l’agente di riferimento e il codice di valutazione con licenza Apache 2.0.

Fonti

Come è scritto

Scritto con modelli di IA e controllato secondo lo standard di AI.info: la fonte viene aperta, ogni fatto è controllato su almeno due fonti indipendenti e una lettura critica cerca ciò che è sbagliato. Il curatore di AI.info risponde di ciò che viene pubblicato. Lo standard

Esplora

Altri articoli