The Pulse
Epoch AI giudica difettosi 9 benchmark di IA su 15
Epoch AI ha esaminato 15 benchmark esterni di IA e ha riscontrato problemi sostanziali in nove di essi. La sua verifica segnala errori di valutazione, impostazioni di test deboli, versioni e condizioni incoerenti che possono alterare il con

AI.info Team ·
Epoch AI ha classificato come difettosi nove dei 15 benchmark esterni di IA esaminati, mettendo in luce debolezze sostanziali in diversi test ampiamente utilizzati per misurare le capacità dei modelli. L’elenco delle verifiche, aggiornato al 12 settembre, comprende SWE-bench Verified, Humanity’s Last Exam, Terminal-Bench 4.0.0, DeepSWE v1.1 e Berkeley Function Calling Leaderboard v4.
Questo non significa che tutti i punteggi ottenuti con quei benchmark siano privi di valore. Epoch definisce difettoso un benchmark che presenta almeno una grave criticità in grado di influire sull’interpretazione dei risultati. L’organizzazione precisa che le sue verifiche riguardano specifiche versioni dei benchmark e che una versione successiva può essere valutata a parte se gli sviluppatori correggono i problemi.
Epoch ha pubblicato il proprio quadro di valutazione e i risultati nella documentazione delle verifiche dei benchmark. La prima serie comprende quattro benchmark classificati come Verified, nove come Flawed e due come Not enough information.
Quindici verifiche, nove giudizi negativi
Il gruppo dei benchmark difettosi spazia dall’ingegneria del software alla salute, dalla conoscenza generale alla scrittura e all’uso di strumenti. Il 10 settembre Epoch ha classificato come difettosi Berkeley Function Calling Leaderboard v4 e HealthBench Professional, seguiti da DeepSWE v1.1 il 7 settembre e da Terminal-Bench 4.0.0 il 4 settembre.
Le verifiche precedenti avevano segnalato SWE-bench Verified e SWE-Bench Pro, due importanti test delle prestazioni nell’ingegneria del software. Anche Humanity’s Last Exam, Lech Mazur Writing e TextQuests hanno ricevuto un giudizio di difettosità. Le due voci rimanenti, CritPt e FrontierCode, non sono state valutate perché Epoch ha dichiarato di non disporre di informazioni sufficienti per assegnare un’etichetta Verified o Flawed.
Quattro benchmark hanno superato lo standard minimo dell’organizzazione: ExploitBench v0.1, SimpleQA Verified, PostTrainBench v1.1 e WeirdML v2. La tabella pubblicata da Epoch riporta le date delle verifiche e i relativi giudizi per tutti e 15 i benchmark.
Cosa considera una grave criticità Epoch
Il sistema di valutazione di Epoch distingue tra la possibilità di esaminare un benchmark e la capacità del suo sistema di punteggio di produrre un risultato significativo. La verifica può procedere quando sono disponibili tutti i compiti e la logica di valutazione, oppure quando è possibile esaminare un campione rappresentativo e le impostazioni della valutazione sono documentate per intero. Se queste condizioni non sono soddisfatte, il benchmark riceve il giudizio Not enough information, anziché una valutazione della qualità.
Per i benchmark che possono essere esaminati, Epoch cerca errori che modificano i punteggi o compromettono la capacità che il test dichiara di misurare. Tra gli esempi cita compiti impossibili da risolvere così come sono formulati, valutatori troppo rigidi o errati che producono falsi negativi, criteri di valutazione permissivi che consentono il reward hacking e scorciatoie che permettono a un modello di recuperare una risposta dall’ambiente di valutazione.
Lo standard riguarda anche la coerenza del benchmark, l’elicitation dei modelli e i bias di valutazione. I risultati possono non superare la verifica di coerenza se il valutatore, le istruzioni o le risposte corrette cambiano senza che venga aggiornata la versione. Epoch esamina inoltre se i limiti di token, i limiti di tempo, l’accesso agli strumenti, gli ambienti sandbox e le impalcature offrano ai modelli condizioni eque per svolgere il test.
La soglia del 20 per cento
La soglia predefinita di Epoch è quantitativa: almeno il 20 per cento del campione esaminato deve contenere errori, oppure un singolo problema deve compromettere la valutazione su vasta scala. Per i benchmark con più di 50 compiti, i revisori esaminano un campione di 50 domande, ampliandolo a 100 quando il tasso di errore osservato è compreso tra il 15 e il 25 per cento. I benchmark con 50 compiti disponibili o meno vengono valutati integralmente.
La soglia si applica allo standard minimo necessario per ottenere l’etichetta Verified. Un benchmark può presentare limitazioni senza essere classificato come difettoso, ma una criticità che supera la soglia determina la conclusione della verifica con un giudizio Flawed. Epoch afferma di interrompere l’esame una volta individuati errori sufficienti e non sostiene che la prima verifica abbia rilevato ogni possibile problema.
Le etichette di Epoch si riferiscono a una specifica versione. Gli sviluppatori di un benchmark possono pubblicare una versione corretta, ma l’etichetta assegnata alla versione esaminata da Epoch non cambia automaticamente.
Perché le condizioni dei benchmark contano
La documentazione di Epoch pone particolare enfasi sulle condizioni in cui si svolge un test, non solo sulle sue domande. I risultati di un modello possono cambiare se gli sviluppatori modificano l’impalcatura, i limiti delle risorse, i prompt di sistema, l’accesso agli strumenti o le regole di terminazione. L’organizzazione cita un’analisi precedente secondo cui le modifiche all’impalcatura hanno prodotto differenze fino all’11 per cento per GPT-5 e fino al 15 per cento per Kimi K2 Thinking.
Queste condizioni complicano il confronto tra gli sviluppatori di modelli. Una classifica può sembrare ordinare i modelli in base alle capacità, pur riflettendo anche differenze nei prompt, nei framework per agenti, nei limiti di token o nei permessi dell’ambiente. Se il benchmark non rende note queste impostazioni, i ricercatori esterni hanno meno possibilità di riprodurre o interpretare il risultato.
Epoch avverte inoltre che gli ambienti agentici possono creare opportunità di reward hacking. Un modello può ottenere un punteggio elevato grazie a una scorciatoia, a un exploit o a una debolezza dell’ambiente, anziché dimostrare la capacità che il benchmark dichiara di misurare.
Un sistema di verifica pensato per il controllo pubblico
Epoch afferma di aver selezionato il campione iniziale per coprire diversi tipi di errore e ambiti di ricerca. L’organizzazione intende dare priorità ai benchmark con ampia diffusione, molte citazioni, inclusi nelle recenti system card, rilevanti per la sicurezza o poco rappresentati nelle verifiche già svolte. I test che richiedono conoscenze specialistiche potrebbero richiedere più tempo, perché l’organizzazione prevede di coinvolgere esperti esterni del settore.
L’organizzazione non esamina i benchmark che ha creato, per evitare conflitti di interesse. Afferma inoltre di contattare gli sviluppatori dei benchmark almeno un giorno prima della pubblicazione e di pubblicare integralmente una loro eventuale risposta, se desiderano che venga inclusa.
Il risultato immediato è una lettura più cauta delle classifiche dei benchmark. Nove dei 15 test esaminati presentano problemi che Epoch considera abbastanza gravi da influire sull’interpretazione, mentre altri due non possono ancora essere valutati sulla base delle informazioni disponibili. Per chi confronta i modelli, il solo nome del benchmark non basta più: la versione, le regole di valutazione e le condizioni del test contano ormai quanto la percentuale finale.