Vai al contenuto
AI.info

The Pulse

Il modello da 75 milioni di parametri di Cognizant raggiunge il 76% su ARC-AGI 1

Cognizant AI Lab riferisce che un transformer da 75 milioni di parametri ha raggiunto circa il 76% di pass@2 sul set di valutazione pubblico di ARC-AGI 1, dopo poco più di quattro ore di addestramento e valutazione su una singola GPU NVIDIA

Il modello da 75 milioni di parametri di Cognizant raggiunge il 76% su ARC-AGI 1

AI.info Team ·

Un modello piccolo mette in discussione la ricetta che punta tutto sulla scala

Cognizant AI Lab afferma che un transformer da 75 milioni di parametri raggiunge circa il 76% di pass@2 sul set di valutazione pubblico di ARC-AGI 1, un benchmark basato su enigmi di trasformazione di griglie inediti. Il risultato colloca un sistema addestrato in modo mirato nella fascia di prestazioni associata a modelli di ragionamento molto più grandi.

La distinzione è importante. Il dato di Cognizant proviene dal set di valutazione pubblico, disponibile gratuitamente, di ARC-AGI, e l’azienda afferma che il sistema non è stato valutato sulla leaderboard privata del benchmark. Anche il confronto con i modelli più grandi si basa su misure di costo diverse: Cognizant include sia l’addestramento del modello da zero sia la generazione delle risposte, mentre i dati pubblicati per gli altri sistemi riguardano in genere la sola inferenza.

Anche tenendo conto di questi limiti, l’esperimento mette in discussione l’idea che per migliorare il ragionamento astratto sia necessario aggiungere parametri e potenza di calcolo. Il modello di Cognizant è progettato appositamente per ARC-AGI, anziché essere addestrato come sistema linguistico generalista, e secondo l’azienda l’addestramento e la valutazione richiedono poco più di quattro ore su una singola GPU NVIDIA H100.

ARC-AGI premia l’adattamento, non la memorizzazione

Le attività di ARC-AGI presentano alcune coppie di griglie di input e output e chiedono al sistema di dedurre la regola di trasformazione prima di applicarla a una nuova griglia. Ogni attività fornisce in genere solo da due a sei esempi e la regola cambia da un’attività all’altra. Le griglie possono contenere al massimo 30 per 30 celle e usare dieci colori possibili, ma le loro dimensioni ridotte non rendono semplice il problema di ragionamento.

Un sistema potrebbe dover completare un motivo, spostare oggetti come se fossero soggetti alla gravità, rimuovere tutto tranne la struttura più grande oppure mantenere un oggetto cambiandone la posizione. Il benchmark non offre un’ampia raccolta di esempi quasi identici da cui un modello possa imparare gradualmente la risposta. Verifica se il sistema sa individuare le relazioni pertinenti sulla base di pochi indizi e applicarle a un caso inedito.

Questo scenario mette in luce una debolezza del consueto modello di addestramento dei sistemi di IA. I modelli preaddestrati su dati generici traggono forza da enormi insiemi di dati e rappresentazioni generaliste, mentre ARC-AGI richiede di imparare rapidamente da una manciata di esempi. L’approccio di Cognizant interviene sulla rappresentazione del modello e sull’obiettivo di addestramento, invece di aumentare le dimensioni del modello.

Quattro scelte progettuali determinano gran parte del risultato

Il modello è un transformer autoregressivo, ma il suo vocabolario di input contiene solo 14 token: i dieci colori delle griglie e quattro token strutturali usati per indicare i confini delle sequenze, separare le griglie e segnalare l’inizio di nuove righe. A ogni cella vengono inoltre assegnate coordinate per la riga, la colonna e la posizione tra le griglie di esempio e quelle di test. In questo modo si preservano le relazioni bidimensionali che potrebbero andare perse appiattendo una griglia in una sequenza unidimensionale.

Cognizant addestra il sistema su dati relativi ad ARC, comprese le coppie di esempi fornite con le attività di valutazione pubbliche, ma non sugli output di test tenuti da parte e usati per calcolare il punteggio finale. Il set di addestramento viene ampliato tramite ricolorazione, rotazione, riflessione e ridimensionamento, trasformazioni che preservano la relazione tra un input e il suo output.

Il guadagno prestazionale più diretto deriva dalla predizione di più token. Secondo Cognizant, una versione convenzionale che predice solo il token successivo raggiunge circa il 70% su ARC-AGI 1. Una versione addestrata a predire quattro token in anticipo raggiunge circa il 76% e consente al tempo stesso una generazione più rapida tramite decodifica auto-speculativa.

In fase di inferenza, il sistema trasforma in vari modi le griglie di esempio e di test, genera output candidati e inverte tali trasformazioni. Semplici controlli simbolici eliminano i candidati che violano le relazioni condivise dagli esempi, come un rapporto costante tra le dimensioni dell’input e quelle dell’output. I candidati rimanenti vengono classificati con un punteggio di verosimiglianza aumentato, calcolato sulle diverse versioni trasformate.

Diciassette minuti bastano per un banco di prova più debole ma utile

Il sistema finale raggiunge circa il 76% di pass@2: ciò significa che uno dei due output proposti in cima alla classifica è corretto per circa tre attività su quattro nel set di valutazione pubblico. Cognizant addestra anche otto modelli indipendenti, riuniti in un ensemble, portando il risultato su ARC-AGI 1 a circa l’80%.

Una configurazione più rapida mostra il compromesso tra prestazioni e tempi di esecuzione. L’addestramento richiede circa 12 minuti e la valutazione altri cinque, per un totale di circa 17 minuti. Questa versione raggiunge circa il 44% su ARC-AGI 1 e offre ai ricercatori un modo per testare nuove rappresentazioni e obiettivi senza dover aspettare ore per ogni esperimento.

Il sistema genera 48 candidati per ogni input di test e, per circa l’83% delle attività di ARC-AGI 1, la risposta corretta è presente tra questi. Il processo di selezione colloca la risposta corretta tra le prime due solo circa il 76% delle volte. Per l’ensemble di otto modelli, queste percentuali salgono rispettivamente a circa il 91% e l’80%.

Questo divario indica che la selezione dei candidati è una possibile fonte concreta di miglioramento. A volte il modello di Cognizant produce la soluzione giusta ma non riesce a classificarla abbastanza in alto: un metodo di valutazione migliore potrebbe quindi aumentare il risultato finale senza modificare il transformer sottostante.

ARC-AGI 2 mostra fin dove può arrivare la specializzazione

Il risultato è meno netto sul più difficile benchmark ARC-AGI 2. Un modello raggiunge circa il 17%, mentre l’ensemble di otto modelli arriva a circa il 22%. Questi punteggi mostrano che il sistema ottiene ottimi risultati in una valutazione circoscritta e strutturata, ma non ha risolto il ragionamento astratto come problema generale.

Cognizant indica nella pianificazione globale, nel conteggio e nella capacità di preservare la forma esatta di un oggetto in movimento alcuni ambiti in cui il modello incontra ancora difficoltà. Anche il confronto dell’azienda esclude una conclusione più ampia: i sistemi specializzati non sostituiscono i modelli di frontiera in attività non correlate. Il vantaggio del modello deriva dal vocabolario ristretto, dalla rappresentazione spaziale, dall’aumento mirato dei dati e da un obiettivo allineato alla struttura di ARC-AGI.

L’esperimento offre invece una lezione ingegneristica più circoscritta. Quando i dati hanno una struttura interna chiara, appiattirli trasformandoli in testo generico può comportare uno spreco di informazioni e potenza di calcolo. Un modello progettato per lavorare con le griglie può richiedere molti meno parametri di un sistema generalista, così come i sistemi per transazioni, immagini, registri o letture di sensori possono trarre vantaggio da rappresentazioni costruite sulle relazioni proprie dei rispettivi dati.

Il risultato di Cognizant AI Lab va quindi letto come una stima basata sul set pubblico e come una piattaforma rapida per la ricerca, non come una nuova posizione ufficiale nella classifica di ARC-AGI. La tesi concreta, più circoscritta e più sostenibile, è che un transformer da 75 milioni di parametri, addestrato da zero ed eseguito su una singola H100, può collocare una risposta corretta tra le prime due per circa il 76% delle attività pubbliche di ARC-AGI 1.

Fonte

Esplora

Altri articoli