The Pulse
Il benchmark Eon rileva che gli agenti aziendali non colgono i fatti nascosti
I ricercatori di Eon hanno testato 12 configurazioni di agenti aziendali con domande che richiedevano di dedurre fatti da documenti aziendali simulati. La configurazione migliore ha risposto correttamente a 18 tentativi su 24, mentre le dom

AI.info Team ·
Gli agenti aziendali, che nelle domande dirette sui dati aziendali avevano ottenuto da 22 a 25 punti su 27, hanno faticato quando la risposta dipendeva da indizi sparsi in più documenti. Un articolo inviato ad arXiv il 24 settembre presenta otto test di questo tipo per il benchmark Era by Eon, che misura se gli agenti sono in grado di dedurre fatti non riportati in nessun singolo documento. Nel test degli autori, la configurazione con i risultati migliori ha risposto correttamente a 18 tentativi su 24.
Dalle regole esplicite ai fatti nascosti
Era by Eon genera un’azienda fittizia e rende accessibili i suoi documenti attraverso applicazioni aziendali simulate. Le domande precedenti esplicitavano le regole necessarie per calcolare una risposta, consentendo agli agenti in grado di eseguire codice di cercare e fare calcoli. Le nuove domande, invece, richiedono agli agenti di collegare indizi tra sistemi diversi, come un documento di vendita, una chiamata con un cliente e una richiesta di assistenza.
Un esempio riguarda una vendita persa. Il sistema di vendita attribuisce la decisione del cliente alle tempistiche, ma una chiamata registrata indica un’interruzione del servizio; per identificare la causa effettiva occorre trovare la chiamata pertinente e collegarla alla giusta richiesta di assistenza. Gli otto modelli del benchmark mettono alla prova anche domande su crediti di servizio, contatti che hanno lasciato l’azienda, importi discordanti delle trattative, attività della roadmap, offerte di rinnovo firmate e ricostruzione di una pipeline di vendita a partire da un vecchio rapporto.
Claude Fable 5.1 guida il test
I ricercatori hanno testato 12 configurazioni, abbinando sei modelli linguistici a due programmi per agenti. Un programma non era in grado di eseguire codice; la configurazione basata su LangGraph poteva eseguire script in un ambiente sandbox. Ogni configurazione ha provato ciascuna delle otto domande tre volte, per un totale di 24 esecuzioni.
Claude Fable 5.1 ha ottenuto 18 risposte corrette con il programma Era per agenti, che non esegue codice, e 15 con LangGraph. GPT-6 Astra ne ha ottenute rispettivamente 13 e 12. Secondo l’articolo, gli altri quattro modelli hanno ottenuto al massimo sei risposte corrette con ciascuno dei due programmi.
Nel benchmark, il codice ha fatto una grande differenza sulle domande risolvibili con calcoli: GPT-6 Astra ha risposto correttamente a 24 domande su 27 con LangGraph, contro le otto ottenute usando il programma Era. Lo stesso vantaggio non si è osservato nel test sui fatti nascosti. Per Claude Fable 5.1, il punteggio è stato più alto senza codice che con il codice.
I documenti simili rivelano un’altra debolezza
Le domande più difficili chiedevano agli agenti di individuare il documento pertinente tra diversi candidati plausibili. In un esempio, un cliente aveva ricevuto tre offerte di rinnovo e l’agente doveva determinare quale avesse firmato. In due domande di questo tipo, i dodici agenti hanno risposto correttamente complessivamente in 1 tentativo su 84.
Questa lacuna è importante per l’uso sul posto di lavoro, perché spesso le conoscenze aziendali sono distribuite tra sistemi e conversazioni separati, anziché raccolte in un unico campo. I risultati, tuttavia, si basano su otto domande riguardanti un’unica azienda generata, non su un ampio campione di applicazioni reali. Gli autori sostengono che agli agenti manchi ben poco:
«Le conoscenze mancanti sono poche. Si tratta di una manciata di fatti del tipo che un dipendente apprende nelle prime settimane: quale sistema contiene l’importo concordato, in quale giorno è stata modificata la roadmap, come viene calcolata la revisione della pipeline.»
Gli autori dell’articolo su Era by Eon
Gli autori scrivono che un archivio scritto di questi fatti li trasformerebbe da conoscenze nascoste a informazioni documentate e che il benchmark potrebbe misurare quanto sia utile eseguendo gli stessi agenti con e senza tale archivio. L’articolo non riporta i risultati di questo esperimento.