Vai al contenuto
AI.info

Orizzonti futuri

ARC-AGI-3 è caduto in cinque mesi: perché saturare un benchmark non significa ancora raggiungere l’AGI

ARC-AGI-3 è stato lanciato nel marzo 2026, con gli esseri umani al 100% e l’IA di frontiera allo 0,51%. Entro il 3 settembre, GPT-6 Astra aveva ottenuto 99,9 punti con l’harness di OpenAI e 62,7 con uno neutrale. Che cosa misuravano quei ri

ARC-AGI-3 è caduto in cinque mesi: perché saturare un benchmark non significa ancora raggiungere l’AGI

Gabriele Masetti ·

Che cosa doveva misurare ARC-AGI-3

Il 25 marzo 2026, ARC Prize Foundation ha pubblicato ARC-AGI-3, il primo benchmark interattivo di una serie che fino ad allora era stata composta da rompicapi statici a griglia. Comprende centinaia di ambienti a turni, ciascuno realizzato a mano da progettisti di giochi, per un totale di migliaia di livelli. Un agente non riceve istruzioni né una descrizione dell’obiettivo. Deve esplorare, capire che cosa significhi vincere, costruire un modello di come reagisce l’ambiente e pianificare una sequenza di azioni.

Il risultato della calibrazione era il punto centrale dell’esperimento.

I nostri test mostrano che gli esseri umani riescono a risolvere il 100% degli ambienti, mentre i sistemi di IA di frontiera, a marzo 2026, ottengono un punteggio inferiore all’1%. — ARC Prize Foundation, rapporto tecnico di ARC-AGI-3, marzo 2026

La serie esiste perché i benchmark precedenti continuavano a cedere. La competizione ARC Prize 2025 ha attirato 1.455 team e 15.154 partecipazioni per ARC-AGI-2, e il punteggio migliore sul set di valutazione privato è stato del 24%: un progresso reale rispetto a un valore prossimo allo zero, ma ancora molto al di sotto dei risultati degli esseri umani sui quali erano stati calibrati i rompicapi. ARC-AGI-3 è stato progettato per riaprire un divario che il lavoro ingegneristico continuava a colmare.

Al lancio, i modelli di frontiera ottenevano in media lo 0,51%. Il punteggio valuta l’efficienza, non il solo completamento: un livello conta per intero soltanto se un agente lo supera con un impiego di azioni all’incirca pari a quello degli esseri umani usati come riferimento. Per questo la fondazione descrive un punteggio perfetto come il superamento di ogni gioco da parte degli agenti con la stessa efficienza degli esseri umani. Per scelta progettuale, gli ambienti escludono il linguaggio e le conoscenze esterne, lasciando soltanto quelle che ARC chiama conoscenze preliminari di base — oggetti, conteggio, geometria elementare.

Cinque mesi dallo 0,51% a 99,9

Il 1° maggio 2026, ARC Prize ha pubblicato un’analisi dei replay di due modelli di frontiera sul set semi-privato: GPT-5.5 ha ottenuto lo 0,43%, Claude Opus 4.7 lo 0,18%. Secondo la lettura dei replay proposta dalla fondazione, i due modelli fallivano in modi diversi — uno comprimeva l’ambiente in modo errato, l’altro non lo comprimeva affatto — e i punteggi aggregati nascondevano questa distinzione.

A metà estate la curva ha cambiato direzione. GPT-5.6 Sol ha raggiunto il 7,78% e Claude Opus 5 il 30,16%. Il 21 agosto Nvidia ha riferito che la sua architettura per agenti AVO, costruita attorno a Claude Opus 5 senza modificarlo, aveva completato tutti i 183 livelli del set pubblico di 25 ambienti in 6.624 azioni, ottenendo un punteggio di efficienza perfetto: un risultato sul set pubblico, come precisa lo stesso post di Nvidia, non su quello semi-privato o privato.

Poi, il 3 settembre, OpenAI ha pubblicato GPT-6 Astra e ARC Prize ha diffuso la propria analisi lo stesso giorno. Astra ha ottenuto il 62,7% con l’harness standard, a un costo misurato di 26.098 dollari, e il 99,9% tramite l’adattatore di OpenAI, a 18.817 dollari. Nel test con l’adattatore ha impiegato meno azioni degli esseri umani usati come riferimento nel 96% dei livelli e, in media, il 51,7% di azioni in meno per livello. Un test in cui a marzo nessun punteggio dell’IA superava l’1% ne registrava uno quasi perfetto a settembre.

L’harness fa parte del lavoro

Il divario di circa 37 punti tra i due punteggi di Astra non è rumore statistico, né dipende da una differenza nei pesi del modello. L’harness standard offre a ogni modello la stessa interfaccia minima, neutrale rispetto al fornitore. L’adattatore del fornitore consente invece al modello di usare i meccanismi di gestione del contesto sviluppati per lui dal proprio laboratorio: per Astra, questo significa mantenere lo stato del ragionamento tra una chiamata e l’altra, anziché ripartire ogni volta da zero.

Il risultato di Nvidia dimostra la stessa cosa da un’altra prospettiva. All’interno di Claude Opus 5 non è cambiato nulla: nessun nuovo addestramento, nessun fine-tuning, nessuna modifica ai pesi. Una memoria persistente e un livello di supervisione esterni al modello lo hanno portato da circa il 30% al completamento senza errori del set pubblico. Qualunque cosa si stia misurando, una parte consistente risiede nell’impalcatura che circonda il modello, anziché nella rete.

La distinzione è importante per la questione dell’AGI in un senso preciso. Il punteggio di un benchmark è una proprietà di un sistema, e il sistema comprende l’harness. Interpretarlo come una proprietà del modello equivale a considerare il risultato di un esame una proprietà del cervello di uno studente, ignorando gli appunti che gli era consentito portare con sé.

Un singolo strumento, inoltre, non rappresenta il verdetto dell’intero settore. Nella stessa settimana, Artificial Analysis ha assegnato ad Astra un Intelligence Index di 61, alla pari con il suo predecessore GPT-5.6 Sol e cinque punti dietro Claude Fable 5.1 di Anthropic, a 66; l’indice delle capacità di Epoch AI ha invece collocato Astra al primo posto su oltre cinquanta test. Un sistema può essere il più generale mai misurato da uno strumento e rappresentare un progresso incrementale secondo un altro: è ciò che accade quando gli indici compositi attribuiscono pesi diversi alle varie capacità.

Chi ha costruito il test dice che non è il traguardo

L’analisi di Astra pubblicata dalla stessa ARC Prize è insolitamente esplicita sui limiti del proprio strumento.

«Pur ritenendo che Astra rappresenti un progresso significativo verso la generalizzazione, non sosteniamo che sia un’IA generale». — ARC Prize Foundation, analisi di GPT-6 Astra su ARC-AGI-3, 3 settembre 2026

La ragione dichiarata è strutturale, non diplomatica. ARC-AGI-3 ha un ambito e un formato strettamente delimitati; i suoi ambienti hanno meccaniche e obiettivi deterministici e circoscritti, e non rappresentano la complessità e la natura aperta del mondo reale. La sua saturazione non è mai stata presentata come prova di alcunché, né al lancio né in seguito.

François Chollet, che ha introdotto il benchmark ARC nel 2019 e trasformato ARC Prize in una fondazione all’inizio del 2025, ha rivisto una cosa: i tempi. Quando, al lancio, gli era stato chiesto quanto ci sarebbe voluto per saturarlo, aveva risposto circa un anno. Astra è arrivato in circa metà del tempo e, quando a settembre gli è stato chiesto se fosse ancora valida la sua stima dell’arrivo dell’IA generale intorno al 2030, ha risposto che sarebbe arrivata prima, dato che i progressi procedevano più rapidamente di quanto si aspettasse.

I prossimi strumenti sono già in programma. ARC-AGI-4 è previsto per l’inizio del 2027, secondo una cadenza annuale che, dice Chollet, mira a far sì che ogni nuovo benchmark non sia già saturo al momento del lancio; ARC-AGI-5 è previsto dopo. La fondazione afferma di stare studiando come valutare l’auto-miglioramento ricorsivo e l’innovazione aperta; secondo le ricostruzioni delle dichiarazioni di Chollet, la quarta versione riguarderà l’apprendimento continuo e curricolare su orizzonti temporali più lunghi, mentre la quinta riguarderà l’invenzione aperta.

Chollet ha descritto il traguardo in termini operativi anziché filosofici: continueranno ad arrivare nuove versioni finché non sarà più possibile proporre un compito che le persone comuni sanno svolgere e le macchine no. In questa lettura, l’esistenza stessa di un ARC-AGI-4 finanziato e già in programma è la risposta attuale alla domanda se il lavoro sia finito.

Cinque definizioni, e il benchmark non ne risolve nessuna

La carta programmatica del 2018 di OpenAI definisce l’IA generale come sistemi altamente autonomi che superano gli esseri umani nella maggior parte delle attività economicamente rilevanti. Un punteggio ottenuto su un insieme chiuso di giochi è una prova delle capacità, non della sostituzione del lavoro umano, e il quadro teorico pubblicato da Google DeepMind nel 2023 chiarisce la distinzione: definire l’IA generale in base al raggiungimento di un certo livello di sostituzione del lavoro richiederebbe un impiego nel mondo reale, mentre definirla in base alla capacità di sostituirlo pone l’accento sul potenziale.

Quell’articolo di DeepMind — firmato da Morris, Sohl-Dickstein, Fiedel, Warkentin, Dafoe, Faust, Farabet e Legg — sostituisce la soglia unica con una griglia che incrocia sei livelli di prestazione con la distinzione tra IA specializzata e generale. La tabella pubblicata colloca i modelli conversazionali di frontiera al livello 1 dell’IA generale, «IA generale emergente», e indica che nessuno dei livelli generali superiori è stato ancora raggiunto. Non è stata pubblicata alcuna ricollocazione di un modello del settembre 2026 su quella griglia sottoposta a revisione paritaria.

La definizione più antica ancora in uso è anche la meno rigorosa. Shane Legg e Marcus Hutter, scrivendo nel 2007, passarono in rassegna decine di descrizioni informali dell’intelligenza e le ridussero a una sola frase: la capacità di un agente di raggiungere obiettivi in un’ampia gamma di ambienti. Legg ha cofondato DeepMind ed è coautore dell’articolo sui livelli, quindi la continuità è diretta. La parola decisiva nella formula del 2007 è «gamma», e un insieme fisso di giochi costruiti a mano la limita per definizione.

La definizione resa operativa da ARC-AGI è quella di Chollet: l’intelligenza di un sistema misura l’efficienza con cui acquisisce nuove competenze in un insieme di compiti, tenendo conto delle conoscenze pregresse, dell’esperienza e della difficoltà di generalizzazione. Secondo questa definizione, l’IA generale arriva quando non resta alcuna differenza misurabile nell’efficienza di apprendimento tra macchine e persone. È per questo che a un benchmark saturo ne segue uno più difficile, non una dichiarazione.

Una quarta definizione è psicometrica. «A Definition of AGI», pubblicato nell’ottobre 2025 da Dan Hendrycks, Yoshua Bengio, Gary Marcus, Erik Brynjolfsson e più di due dozzine di coautori, valuta i sistemi in dieci domini cognitivi tratti dalla teoria di Cattell-Horn-Carroll. Riporta un punteggio del 27 per cento per GPT-4 e del 57 per cento per GPT-5, con le carenze concentrate nella conservazione della memoria a lungo termine. Un articolo successivo sostiene che una media semplice fa apparire il risultato migliore di quanto sia e che un punteggio aggregato ponderato per la coerenza collochi GPT-5 più vicino al 24 per cento.

Una quinta definizione era un contratto, e ora è decaduta. Un accordo tra Microsoft e OpenAI legava un tempo l’IA generale a sistemi capaci di generare 100 miliardi di dollari di profitti; nell’ottobre 2025 la decisione fu affidata a un gruppo di esperti indipendenti e la rinegoziazione dell’aprile 2026 rese la condivisione dei ricavi indipendente dai progressi tecnici, eliminando quella clausola. L’unica definizione a cui fosse legato del denaro è stata abbandonata prima che qualcuno provasse a soddisfarla.

Che cosa osservano gli esperti di previsioni

Su Metaculus, la previsione collettiva per un’IA debolmente generale resta intorno al 2028, sulla base delle stime di circa 1.800 partecipanti, mentre quella per un primo sistema pienamente generale resta intorno al 2033, sulla base delle stime di circa 1.900 partecipanti: valori sostanzialmente invariati fino a metà settembre 2026, anche se i sistemi che monitorano le previsioni non concordano sul mese esatto. Nelle due settimane in cui è stato saturato un benchmark, le previsioni collettive si sono mosse appena.

I laboratori si sono spinti oltre. Greg Brockman, presidente di OpenAI, ha detto ai giornalisti al lancio di Astra che non era «irragionevole» pensare che l’era dell’IA generale fosse cominciata e che fosse ragionevole definire Astra il primo modello di questo tipo, anche se la pagina di lancio di OpenAI evitava di farlo. Gary Marcus ha definito questa interpretazione un’operazione di marketing di chi abbassa l’asticella; Ben Goertzel, che ha reso popolare il termine due decenni fa, ha descritto un sistema sovrumano in alcune cose e inferiore agli esseri umani in altre.

Le prove che nessun benchmark può fornire

Mancano tre tipi di prove, e nessuno è un punteggio. Il primo riguarda l’apprendimento duraturo: un sistema che acquisisce una competenza dopo essere stato messo in uso e la conserva, insieme a quelle già possedute, anche a distanza di mesi. È, grosso modo, l’obiettivo dichiarato di ARC-AGI-4: segno, di per sé, che il settore non ritiene sia stato ancora dimostrato.

Il secondo riguarda l’invenzione, non l’adattamento. Ogni ambiente di ARC ha una soluzione già nota ai suoi progettisti, e l’efficienza rispetto a un riferimento umano viene misurata sulla base di quella soluzione. Un test dell’innovazione senza vincoli deve premiare un sistema che produca uno strumento, una regola o una notazione che nessuno aveva specificato. Stabilire come valutare un risultato del genere è un problema di ricerca ancora irrisolto, non una questione di calendario.

Il terzo è economico, ed è quello che la definizione contenuta nello statuto richiede. Superare gli esseri umani nella maggior parte dei lavori di valore economico è un’affermazione sul lavoro svolto da sistemi effettivamente impiegati, osservabile nelle imprese, nella produzione e nelle mansioni sostituite nell’arco di anni, non in una sessione di valutazione da 26.098 dollari. La commissione di esperti prevista dall’accordo tra OpenAI e Microsoft era un’ammissione parziale di questo fatto, e la clausola è stata eliminata prima ancora che la commissione dovesse riunirsi.

Niente di tutto questo significa che nel 2026 non sia successo nulla di notevole. Un benchmark che i suoi autori pensavano avrebbe retto per un anno è stato superato in cinque mesi, e un modello ha impiegato meno mosse di una persona nel 96 per cento dei livelli che non aveva mai visto.

La lettura corretta è più circoscritta di quanto vorrebbe l’uno o l’altro schieramento. Lo strumento di misurazione più raffinato del settore ci ha mostrato quanto velocemente le macchine sappiano oggi adattarsi all’interno di un mondo chiuso e deterministico. Ogni definizione di intelligenza generale su cui si discute davvero — quella dello statuto, quella di DeepMind, quella di Chollet, quella psicometrica — riguarda invece il mondo aperto.

Esplora

Altri articoli