Approfondimenti tecnici
Il problema dei benchmark: come misuriamo l’intelligenza dell’IA e perché le misure continuano a non reggere
Ogni benchmark dell’IA finisce per saturarsi, essere aggirato o mostrare pubblicamente i propri limiti. Da GLUE e MMLU ad ARC-AGI, FrontierMath e Humanity’s Last Exam, ecco che cosa è successo, con date e numeri, fino a un modello che ottie

Gabriele Masetti ·
Il ciclo di vita che nessuno aveva previsto
Ogni benchmark dell’IA segue ormai lo stesso percorso, che i suoi autori lo vogliano o no. Un gruppo propone un test in cui i modelli del momento vanno molto male. I laboratori puntano a migliorare il punteggio. I risultati salgono finché il test non distingue più i buoni modelli da quelli eccellenti. Qualcuno ne costruisce uno più difficile e il ciclo ricomincia. Negli ultimi otto anni questa sequenza si è ripetuta almeno quattro volte — da GLUE a SuperGLUE, poi a MMLU e infine a GPQA/ARC-AGI/FrontierMath/Humanity’s Last Exam — e il tempo fra la proposta di un test e la sua saturazione continua a ridursi.
Non è la storia di un singolo test progettato male: è ciò che accade quando le capacità dei modelli di frontiera migliorano più in fretta di quanto si riesca ad aggiornare il metro di misura.
Di conseguenza, «lo stato dell’arte nel benchmark X» ha una data di scadenza, sempre più spesso nota a tutti. I creatori di GPQA hanno previsto fin dall’inizio una calibrazione fra esperti e non esperti, aspettandosi che il test si saturasse. Il creatore di ARC-AGI ha costruito un’intera fondazione che assegna premi partendo dal presupposto che ogni test statico prima o poi venga aggirato o effettivamente risolto, e si è impegnato a realizzarne un seguito prima ancora che la prima versione concludesse il suo ciclo. Trattare i benchmark come verità definitive, anziché come strumenti dalla vita utile limitata, è l’errore alla base della maggior parte dei problemi che seguono.
Da GLUE a MMLU: un decennio di soglie sempre più alte
GLUE è stato lanciato nel 2018 per valutare la comprensione del linguaggio a livello di frase attraverso nove compiti. Quell’anno GPT ha ottenuto 72,8 punti e BERT 80,2. All’inizio di luglio 2019, XLNet di Yang et al. aveva portato il punteggio più alto in classifica a 88,4, superando di poco il riferimento umano di 87,1. SuperGLUE è arrivato nel maggio 2019 perché GLUE era diventato troppo facile: al lancio, fra il miglior modello e le prestazioni umane restava ancora un divario di circa 20 punti, ed era proprio questo lo scopo.
Ma non è durato: T5 ha raggiunto 88,9, a meno di un punto dal punteggio umano, e all’inizio del 2020 DeBERTa di Microsoft e T5+Meena di Google avevano entrambi superato il riferimento umano di 89,8.
| Benchmark | Punteggio al lancio | Punteggio successivo / a saturazione |
|---|---|---|
| GLUE (2018) | GPT 72,8 / BERT 80,2 | XLNet 88,4, oltre il riferimento umano di 87,1 |
| MMLU (2020) | GPT-3 175B: 43,9% | Modelli di frontiera sopra l’88% entro il 2026 |
| ARC-AGI-1 | 33% | 55,5% (ARC Prize 2024) |
| FrontierMath (2024) | Sotto il 2% (tutti e 6 i modelli al lancio) | 87-88% (meno di due anni dopo) |
| ARC-AGI-2 (2025) | 24,03%, il vincitore della competizione del 2025 | ~95% nei tracker senza limiti, settembre 2026 |
| ARC-AGI-3 (2026) | 0,51% al lancio | 62,7% o 99,9%, a seconda del sistema di valutazione |
MMLU, pubblicato il 7 settembre 2020 da Dan Hendrycks e coautori (e presentato a ICLR 2021), è stato il successivo nuovo punto di partenza. Comprende 57 materie — dalla matematica elementare al diritto alla virologia — e 15.908 domande a scelta multipla. Al lancio, la maggior parte dei modelli otteneva punteggi vicini al 25% che ci si aspetterebbe rispondendo a caso; GPT-3 175B, il migliore disponibile, raggiungeva il 43,9%.
Nel 2026 tutti i modelli di frontiera superano all’incirca l’88% su MMLU e diversi tracker lo descrivono come ormai saturo, di fatto: un «controllo minimo» utile soprattutto a verificare che un modello funzioni, non a stilare una classifica dei sistemi di frontiera.
Anche GSM8K (8.500 problemi di matematica formulati a parole per la scuola primaria, 2021) e HumanEval (164 problemi di programmazione scritti a mano, introdotti insieme a Codex) sono passati, nel giro di pochi anni, dall’essere strumenti utili a distinguere i modelli a esercizi in cui i punteggi si avvicinano al massimo. Per questo la valutazione delle capacità matematiche e di programmazione è passata a GPQA, FrontierMath e SWE-bench.
La fuga di dati che nessuno può escludere del tutto
La saturazione ha un parente meno presentabile: la contaminazione, che si verifica quando le domande di un test (o loro parafrasi molto simili) finiscono nei dati di addestramento di un modello, gonfiandone i punteggi senza rispecchiare un reale miglioramento delle capacità. Il problema è abbastanza vecchio da comparire negli studi fondativi del settore. Lo studio originale su GPT-3 di Brown et al. (2020) rivelava, nella propria appendice, che un errore nella procedura di filtraggio aveva lasciato entrare dati dei benchmark nell’addestramento. Gli autori avevano inoltre scoperto che C4, un corpus comunemente usato per il preaddestramento, conteneva già le porzioni di test di diversi benchmark, raccolte in blocco da GitHub.
Il rapporto tecnico di OpenAI su GPT-4 si spingeva oltre: descriveva come il gruppo avesse inserito parti dei set di addestramento di MATH e GSM8K nei dati usati per addestrare GPT-4, per migliorarne le prestazioni matematiche, effettuando al tempo stesso un controllo delle sottostringhe in comune per verificare che i set di test tenuti separati non fossero stati duplicati.
Da allora, verifiche indipendenti hanno continuato a trovare contaminazioni misurabili: per Mistral-7B-v0.1 su HellaSwag e GSM8K, per Llama-3-70B su ARC e per le famiglie Phi e Mistral su GSM8K. In quest’ultimo caso, le prestazioni su una nuova raccolta di problemi nello stile di GSM8K (GSM1K) erano inferiori a quelle ottenute sull’originale anche di 13 punti percentuali: un divario compatibile con la memorizzazione, più che con il ragionamento. Niente di tutto questo significa che un particolare laboratorio imbrogli deliberatamente: la contaminazione può entrare attraverso dati di preaddestramento raccolti dal web anni prima che qualcuno esegua una valutazione. Significa però che chi conduce valutazioni con attenzione considera ormai un punteggio privo di una verifica della contaminazione come un’affermazione, non come un fatto.
Costruire benchmark che tengano testa ai modelli
La risposta è stata progettare test capaci di resistere sia alla saturazione sia alla contaminazione. GPQA, pubblicato il 20 novembre 2023 da David Rein e coautori (della NYU, con collaboratori di Anthropic), comprende 448 domande a scelta multipla scritte da esperti con dottorato in biologia, fisica e chimica, concepite per essere «a prova di Google». Il suo sottoinsieme più difficile, GPQA Diamond (198 domande), conserva solo i quesiti su cui entrambi gli esperti incaricati della valutazione erano d’accordo e ai quali la maggior parte dei non esperti qualificati continuava a rispondere in modo errato, pur avendo accesso illimitato al web e oltre 30 minuti per domanda. I dottori di ricerca nelle discipline interessate raggiungono un’accuratezza di circa il 65%; GPT-4, al lancio, si fermava al 39%.
SWE-bench, insieme al sottoinsieme SWE-bench Verified curato da OpenAI e pubblicato il 13 agosto 2024, ha seguito un’altra strada: anziché scrivere nuove domande, prende problemi reali e irrisolti segnalati su GitHub e chiede a un modello di generare una patch che superi la suite di test effettiva del progetto. I 500 compiti di Verified sono stati selezionati dopo che 93 sviluppatori Python professionisti hanno esaminato 1.699 casi candidati per stabilire se fossero risolvibili.
Ha funzionato come strumento per distinguere le prestazioni dei modelli per appena un anno: secondo i dati della stessa OpenAI, lo stato dell’arte è salito dal 74,9% all’80,9% in circa sei mesi. Poi, nel 2025, OpenAI ha pubblicato una verifica da cui è emerso che, dei 138 problemi che il suo modello o3 non riusciva a risolvere con costanza in 64 esecuzioni, il 59,4% presentava test progettati male.
OpenAI ha quindi smesso di pubblicare i punteggi di SWE-bench Verified e ha indirizzato il settore verso SWE-bench Pro: un raro caso in cui lo stesso promotore di un benchmark ne ha annunciato pubblicamente il ritiro.
FrontierMath, lanciato da Epoch AI nel novembre 2024, aveva fissato l’asticella così in alto che tutti e sei i modelli valutati al lancio avevano risolto meno del 2% dei suoi problemi matematici di livello accademico. Meno di due anni dopo, i punteggi migliori avevano superato l’87–88%, un aumento di oltre quaranta volte: abbastanza rapido da spingere Epoch a rivedere il benchmark il 12 giugno 2026, dopo aver trovato errori nel 42% dei problemi originali e averne ridotto il numero a 338. Da allora Epoch ha ampliato la famiglia di benchmark, anziché limitarsi a sfoltirla: FrontierMath comprende ora i livelli da 1 a 4, oltre a una raccolta Open Problems di questioni di ricerca irrisolte con soluzioni verificabili computazionalmente, e a FrontierMath Erdős, problemi aperti formulati o studiati da Paul Erdős e formalizzati in Lean.
ARC-AGI e il premio che resta non assegnato
Il benchmark ARC-AGI di François Chollet affronta la questione da un’altra angolazione: rompicapi astratti su griglie, facili per gli esseri umani senza una preparazione specifica e storicamente difficilissimi per le reti neurali, progettati per mettere alla prova il ragionamento fluido anziché le conoscenze memorizzate. Chollet ha cofondato la ARC Prize Foundation con Mike Knoop per organizzare una competizione annuale il cui premio in denaro non viene assegnato finché non viene superata una soglia precisa.
ARC Prize 2024 ha prodotto il più grande balzo in un solo anno registrato dal benchmark dal 2020: lo stato dell’arte è passato dal 33% al 55,5% sul set originale ARC-AGI-1. Per questo, nel marzo 2025, è stato sostituito da ARC-AGI-2, progettato per resistere alle tecniche di sintesi di programmi e ricerca per forza bruta che avevano risolto la prima versione.
ARC Prize riferisce che ogni compito di ARC-AGI-2 è stato risolto da almeno due delle oltre 400 persone coinvolte nei test a San Diego all’inizio del 2025. ARC Prize 2025 ha attirato 1.455 squadre e 15.154 partecipazioni su Kaggle; la squadra vincitrice NVARC si è classificata prima con il 24,03%, usando un modello addestrato durante il test e costruito con componenti di Tiny Recursive Model: un risultato ben al di sotto della soglia per ottenere il premio, nonostante la vittoria nella competizione.
ARC Prize 2026 ha riorganizzato i premi in denaro, non la soglia. La categoria ARC-AGI-2 mette in palio 700.000 dollari: 275.000 dollari in premi per i progressi compiuti, 275.000 dollari per la migliore descrizione del lavoro resa open source e un bonus di 150.000 dollari per la prima partecipazione idonea a superare l’85% sul set di valutazione privato, che sarà rinviato al 2027 se nessuno ci riuscirà. Una categoria separata, ARC-AGI-3, mette in palio 850.000 dollari, di cui 700.000 riservati al primo agente che raggiungerà il 100%.
I laboratori di frontiera che pubblicano risultati nelle classifiche separate, senza limiti di costo, hanno progredito molto più rapidamente. Quando questo articolo è stato pubblicato per la prima volta, i migliori risultati resi pubblici su ARC-AGI-2 erano il 37,6% di Claude Opus 4.5 con ragionamento esteso, a un costo di circa 2,20 dollari per compito, e il 54% di Gemini 3 Pro di Google con un sistema di perfezionamento iterativo, a circa 30 dollari. A metà settembre 2026, i tracker pubblici LLM-Stats e BenchLM attribuivano entrambi il 95% a GPT-6 Astra di OpenAI e l’85% a GPT-5.5; BenchLM riportava anche il 90,4% per Claude Opus 5.
Stando a questi numeri, un benchmark pubblicato nel marzo 2025 per resistere ai metodi che avevano avuto ragione del suo predecessore era stato superato nel giro di diciotto mesi. La distanza tra il 24% di una partecipazione alla competizione soggetta a un limite di costo e resa open source e il 95% di un modello di frontiera senza vincoli è essa stessa il dato significativo: la capacità pura e quella che merita il premio sono ormai due grandezze distinte, e solo una delle due è sottoposta a una verifica indipendente.
Humanity’s Last Exam e i limiti di rendere difficili le domande
Humanity’s Last Exam, realizzato congiuntamente dal Center for AI Safety e da Scale AI sotto la direzione di Dan Hendrycks, direttore del CAIS — a quanto pare dopo che Elon Musk aveva osservato che MMLU era diventato troppo facile — è stato lanciato nel gennaio 2025 con 2.500 domande di livello post-laurea su matematica (il 41% del totale), scienze fisiche e della vita, discipline umanistiche, informatica e ingegneria. Circa il 14% delle domande era multimodale. È stato pubblicato formalmente su Nature nel gennaio 2026. Al lancio, GPT-4o aveva ottenuto il 2,7%, Claude 3.5 Sonnet il 4,1% e o1 di OpenAI l’8%, contro un valore di riferimento approssimativo del 90% per gli esperti umani nelle rispettive materie.

La difficoltà dell’esame comportava un costo che i suoi creatori non avevano messo in conto. Poiché le domande erano state scelte proprio perché i modelli più avanzati sbagliavano a rispondervi, e i revisori dedicavano non più di cinque minuti a verificare la motivazione di ciascuna risposta, il controllo di qualità era limitato. Nel luglio 2025 il laboratorio di ricerca FutureHouse ha esaminato 321 domande di biologia e chimica basate solo sul testo, usando un agente per la ricerca bibliografica e una revisione umana, e ha riscontrato che circa il 29% (± 3,7%, IC al 95%) aveva risposte in diretto contrasto con la letteratura sottoposta a revisione paritaria.
Una successiva verifica dello stesso team di HLE ha rilevato problemi in circa il 18% di un sottoinsieme di domande. FutureHouse ha pubblicato un sottoinsieme corretto, «HLE Bio/Chem Gold», mentre il team di HLE ha introdotto «HLE-Rolling», una versione sottoposta a revisioni continue per recepire gli errori segnalati, anziché lasciare immutato un insieme di domande difettoso.
Nel frattempo, i punteggi sono comunque saliti molto rispetto al lancio. Secondo il monitoraggio di Artificial Analysis, nel luglio 2026 il modello in testa era al 53,3%; due mesi dopo, sia LLM-Stats sia BenchLM collocavano il primo al 65%, con i tre modelli successivi a meno di mezzo punto percentuale. Un test in cui i punteggi al lancio erano il 2,7% e il 4,1% ora distingue i migliori modelli per differenze dovute agli arrotondamenti, pur contenendo ancora una quota significativa di risposte errate secondo la verifica del suo stesso team. Rendere un test più difficile non lo rende automaticamente più corretto.
Quando sono gli esseri umani a valutare le risposte: l’anno difficile di LMArena
I benchmark statici non sono gli unici a essere sotto pressione. LMArena (già LMSYS Chatbot Arena) classifica i modelli in base ai voti espressi da esseri umani in confronti a coppie, convertiti in un punteggio simile a Elo, e nell’aprile 2025 ha attraversato una propria crisi di credibilità. Meta ha presentato all’Arena un modello denominato «Llama-4-Maverick-03-26-Experimental» — una variante ottimizzata per la chat, non il modello che stava per rilasciare pubblicamente — che si è piazzato al posto n. 2 della classifica, subito dietro Gemini 2.5 Pro.
Quando la versione effettivamente rilasciata al pubblico, Llama-4-Maverick-17B-128E-Instruct, è stata testata separatamente l’11 aprile, si è classificata al 32° posto, 30 posizioni sotto la variante sperimentale che l’aveva rappresentata. I ricercatori che hanno confrontato le risposte hanno riscontrato che la versione sperimentale era nettamente più prolissa e ricca di emoji, uno stile che sembra aver conquistato i voti di preferenza degli utenti indipendentemente dalla qualità di fondo; LMArena ha riconosciuto che «lo stile e il tono delle risposte del modello» avevano dato alla versione ottimizzata un vantaggio che le informazioni rese note non avevano chiarito.
Alcune settimane dopo, un team composto da ricercatori di Cohere Labs, AI2, Princeton, Stanford, Waterloo e della University of Washington ha pubblicato «The Leaderboard Illusion», un’analisi di 68 pagine su circa 2 milioni di confronti nell’Arena tra 243 modelli di 42 fornitori. L’analisi ha rilevato che pochi grandi laboratori proprietari — lo studio cita Meta, Google e OpenAI — avevano accesso a test privati non dichiarati prima del rilascio, alla possibilità di ritirare selettivamente i punteggi e a tassi di campionamento sproporzionatamente elevati rispetto ai concorrenti con modelli open-weight. Ha rilevato inoltre che presentare selettivamente solo le varianti private con i risultati migliori aveva gonfiato alcuni punteggi di circa 100 punti Elo.
LMArena ha pubblicato una risposta in cui contesta alcuni aspetti di questa ricostruzione. La lezione dei due episodi coincide con quella che la contaminazione insegna per i benchmark statici: una classifica è affidabile solo quanto il processo con cui vengono presentati i modelli, a prescindere da quanti esseri umani votino.
Oltre il punteggio: orizzonti temporali e prospettive
Il modo più utile di ripensare agli ultimi due anni non proponeva affatto un quiz più difficile. Nel marzo 2025 METR, organizzazione senza scopo di lucro che valuta l’IA, ha pubblicato «Measuring AI Ability to Complete Long Tasks», definendo l’«orizzonte temporale al 50%» di un modello come la durata di un compito — misurata in base al tempo necessario a un professionista umano esperto — che il modello riesce a portare a termine autonomamente con un’affidabilità del 50%. La valutazione si basa su una serie di compiti di programmazione e ricerca che richiedono da un secondo a sedici ore di lavoro umano equivalente.
Esaminando i modelli più avanzati a partire dal 2019, METR ha riscontrato che questo orizzonte raddoppiava all’incirca ogni sette mesi; in un lavoro successivo che arriva fino al 2025, il tempo necessario per il raddoppio si è ulteriormente ridotto, a circa quattro mesi. La domanda non è più «quale punteggio ha ottenuto il modello», ma «quanto può durare un compito che affido a questo sistema per poi lasciarlo lavorare da solo»: una prospettiva più vicina a ciò che richiede davvero l’impiego dell’IA in un flusso di lavoro reale.
LiveBench, oggetto di uno studio ICLR Spotlight del 2025, sostituisce ogni mese circa un sesto delle proprie domande — ricavate da nuovi studi su arXiv, notizie e altri materiali pubblicati dopo la data limite — così che l’intero insieme si rinnova ogni sei mesi e non può essere memorizzato in anticipo; inoltre valuta ogni risposta rispetto a una soluzione oggettiva, anziché affidarsi al giudizio di un LLM.
Gli insiemi di test privati tenuti da parte, le valutazioni specifiche per settore condotte all’interno delle singole aziende e i benchmark aggiornati continuamente convergono sul principio già alla base di GPQA e ARC-AGI: un test che non può essere aggirato una volta per poi essere riutilizzato per sempre è migliore di uno che produce un numero chiaro, stabile e confrontabile.
Sei mesi di ARC-AGI-3 e il punteggio che dipende dall’infrastruttura di esecuzione
ARC-AGI-3, il benchmark interattivo per agenti, simile a un gioco, lanciato da Chollet il 25 marzo 2026, ha condotto quell’esperimento più rapidamente di quanto chiunque si aspettasse. Al lancio, i modelli di punta hanno ottenuto lo 0,51% in ambienti che gli esseri umani risolvono completamente. Il 1° maggio 2026, ARC Prize ha riportato uno 0,43% per GPT-5.5 e uno 0,18% per Claude Opus 4.7 sull’insieme semiprivato. Dopo sei settimane, il muro era ancora lì.
Il 3 settembre 2026, ARC Prize ha pubblicato la sua valutazione di GPT-6 Astra di OpenAI, e il muro era crollato. Astra ha ottenuto il 62,7% su ARC-AGI-3 Semi-Private, a un costo di 26.000 dollari. Eseguito tramite l’infrastruttura che ARC Prize chiama Provider Adapter, lo stesso modello, sugli stessi compiti, ha raggiunto il 99,9% per 19.000 dollari. ARC Prize ha inoltre rilevato che Astra ha impiegato meno azioni del riferimento umano nel 96,0% dei livelli.
I due punteggi vanno letti insieme: l’argomento di questo saggio sta nello scarto tra loro. Un modello, un benchmark, un valutatore, una pubblicazione e 37 punti percentuali che dipendono interamente dalla struttura di supporto con cui viene eseguito il modello. ARC Prize ha usato cautela, scrivendo: «Sebbene riteniamo che Astra rappresenti un progresso significativo verso la generalizzazione, non sosteniamo che sia un’AGI».
Il termine per presentare le candidature ad ARC Prize 2026 è il 2 novembre e i risultati saranno annunciati il 4 dicembre; a metà settembre, il bonus di 150.000 dollari per chi supera l’85% sull’insieme privato di ARC-AGI-2 non era ancora stato assegnato. A separare un 95% su un tracker da quel premio non ancora assegnato non è la capacità. Sono l’accesso a internet, la pubblicazione come open source, i limiti di costo e una verifica: le condizioni che danno significato a un numero. Il settore ha passato otto anni a costruire test più difficili. Il problema più difficile si è rivelato trovare un accordo su come eseguirli.