The Pulse
DAYJOB di Surge AI mette alla prova la capacità degli agenti di prendere la decisione giusta
Il 24 settembre 2026, Surge AI ha pubblicato DAYJOB, una suite di benchmark per agenti professionali in ambito sanitario e finanziario. Secondo l’azienda, i modelli con i punteggi più alti hanno superato integralmente meno di un incarico su
AI.info Team ·
Surge AI afferma che il suo nuovo benchmark chiede agli agenti di prendere decisioni che i test sul lavoro tradizionali potrebbero già indicare esplicitamente. La critica dell’azienda a GDPval di OpenAI — secondo cui i suoi compiti spesso prescrivono i passaggi da seguire e misurano la produzione di routine — pone al centro un disaccordo diretto su cosa si debba intendere per capacità professionale. DAYJOB, annunciato il 24 settembre, è il tentativo di Surge di valutare il giudizio che precede la stesura di un documento finale.
La sfida di Surge a GDPval
I primi benchmark di DAYJOB riguardano la sanità e la finanza. Surge afferma che la suite comprende 130 incarichi elaborati da esperti, costruiti attorno a brevi richieste di lavoro e a grandi raccolte di cartelle, rapporti, fogli di calcolo ed e-mail. Invece di indicare all’agente esattamente cosa fare, il compito può chiedergli se sia sicuro inviare un rapporto o se un paziente possa essere dimesso; l’agente deve individuare le prove pertinenti e decidere cosa significano.
Surge confronta la lunghezza media dei prompt di DAYJOB — 81 parole in ambito finanziario e 49 in quello sanitario — con le 337 parole dei compiti di GDPval. Afferma inoltre che gli incarichi di DAYJOB includono molti più file di supporto: in media 25,7 in ambito finanziario e 19,8 in quello sanitario, rispetto a 1,2 per GDPval. Si tratta dei confronti di Surge e della sua interpretazione dei limiti di GDPval; non dimostrano che il benchmark precedente non misuri ogni tipo di competenza professionale.
Un errore di unità fa lievitare il valore a 25,7 milioni di dollari
Un incarico finanziario chiede a un agente di esaminare i rapporti di un fondo prima che vengano inviati a un nuovo cliente. I materiali di supporto includono documenti sulle politiche, listini dei fornitori, rapporti di sistema, quotazioni dei broker ed e-mail. Surge afferma che una posizione è stata valutata sulla base di uno screenshot di Bloomberg che riportava centesimi sudafricani, ma il suo valore è stato inserito in rand: così, una partecipazione del valore di circa 260.000 dollari è sembrata valerne 26 milioni.
GPT-5.6 ha individuato altri due errori relativi alle fonti dei prezzi, per un valore netto di 132.000 dollari, e ha consigliato di ritardare l’invio dei rapporti. Non ha rilevato il ben più grave errore di unità. Su 66 esecuzioni in 22 configurazioni di modelli, afferma Surge, solo due hanno individuato l’errore tra centesimi e rand; entrambe erano esecuzioni di Claude Opus 5. L’esempio verifica se un agente sappia risalire alla fonte di un numero e mettere in discussione un risultato apparentemente plausibile, anziché limitarsi a completare i calcoli.
Il caso sanitario ruota attorno a una diagnosi
In un compito sanitario, un medico chiede a un agente di esaminare i risultati degli esami di laboratorio prima di dimettere un paziente con una debolezza facciale descritta nella comunicazione di passaggio come «paralisi di Bell da manuale». Altri documenti riportano dolore al collo dopo aver sollevato carichi pesanti, difficoltà a parlare e un esame facciale incompleto: dettagli che, secondo Surge, dovrebbero indurre a fare ulteriori accertamenti prima della dimissione.
Surge riferisce che GPT-5.6 ha riconosciuto nel proprio ragionamento la possibilità di una causa vascolare, ma ha deciso di non mettere in discussione la diagnosi se non necessario. Un’esecuzione di Grok, esaminando gli stessi documenti, ha contestato il piano e raccomandato di sospendere la dimissione per una valutazione d’emergenza e un esame di diagnostica per immagini vascolare. Le risposte divergenti illustrano l’obiettivo dichiarato del benchmark: verificare se un agente si accorga quando le prove dovrebbero modificare il percorso d’azione richiesto.
Per superare la prova bisogna soddisfare tutti i criteri della griglia
Surge riferisce che il modello più performante ha superato integralmente il 24,7% degli incarichi di DAYJOB: Healthcare e il 23,9% di quelli di Finance. Queste cifre misurano il superamento completo dei compiti, non l’eventuale ottenimento di un punteggio parziale: le schede pubbliche dei dataset del benchmark definiscono il successo come il soddisfacimento del 100% dei criteri della griglia di valutazione di un compito. La distinzione è importante quando si interpreta un basso tasso di superamento come prova delle prestazioni complessive.
Surge afferma che i compiti sono stati creati da esperti con esperienza diretta nei rispettivi settori e che ogni incarico è passato attraverso tre livelli di revisione per verificarne correttezza, completezza e fattibilità. L’azienda ha pubblicato i materiali dei compiti su Hugging Face per Healthcare e Hugging Face per Finance, insieme a un framework di valutazione su GitHub. I risultati provengono da un benchmark realizzato da Surge, quindi mettono alla prova la definizione di giudizio sul lavoro scelta dall’azienda, ma non costituiscono una misurazione indipendente della frequenza con cui gli agenti falliscono sul lavoro.