The Pulse
GPT-6 Astra mostra un ragionamento efficiente in termini di token in un nuovo studio su arXiv
Un nuovo preprint su arXiv rileva che GPT-6 Astra produce tracce di ragionamento compatte e dirette, mantenendo prestazioni elevate nei compiti di matematica, scienze e generazione di codice.

AI.info Team ·
In un nuovo studio che analizza il modo in cui i modelli linguistici di frontiera affrontano problemi difficili, GPT-6 Astra produce un albero di ragionamento con una mediana di 27 nodi, contro i 136 di Claude Sonnet 5. Secondo i ricercatori, Astra raggiunge profondità simili con molte meno diramazioni, revisioni e tentativi ed errori rispetto agli altri modelli testati.
I risultati provengono da un preprint di Xiaoyu Luo, Tao Ren, Wenrui Yu, Xiao Li, Qiongxiu Li e Johannes Bjerva, affiliati all’Università di Aalborg e a Seafill. Sottoposto ad arXiv il 22 settembre 2026, il lavoro introduce un protocollo che rende visibile il ragionamento intermedio tramite uno strumento definito dal client, quindi confronta le tracce ottenute nei compiti di matematica, scienze e generazione di codice.
Xiaoyu Luo, primo autore del lavoro, ha scritto:
Abbiamo rilevato che Astra mostra un ragionamento diretto efficiente in termini di token, scegliendo prima una traiettoria corretta, mentre risolve internamente i passaggi elementari ed esplicita soltanto il ragionamento cruciale.
Gli autori avvertono che il testo estratto può essere un utile indicatore del comportamento, anziché una registrazione letterale dei calcoli interni del modello. Per i modelli chiusi, la catena di pensiero nativa non è disponibile, quindi i ricercatori non possono stabilire che ogni passaggio visibile corrisponda a ciò che è avvenuto all’interno del modello.
Uno strumento trasforma il ragionamento nascosto in testo registrato
Il protocollo, chiamato FORCED-REASONING, registra uno strumento con un unico argomento testuale a formato libero per il ragionamento intermedio. I ricercatori obbligano il modello a selezionare per primo quello strumento, registrano il testo inserito nella chiamata dello strumento, restituiscono una conferma priva di contenuto e poi consentono al modello di continuare a scegliere tra lo strumento e una risposta finale.
Lo strumento non esegue calcoli esterni. Serve a creare uno spazio di lavoro visibile all’interno della conversazione. Gli esperimenti vengono condotti tramite OpenRouter, con il ragionamento nativo disattivato quando il modello lo consente; Astra non supporta la disattivazione del ragionamento nativo e viene testato all’impostazione minima disponibile.
Prima di studiare i modelli chiusi, i ricercatori testano il metodo su DeepSeek-V4-Flash e GLM-5.2, per i quali è disponibile il ragionamento nativo da usare come confronto. Le tracce estratte da questi modelli raggiungono prestazioni nei compiti quasi pari a quelle native, presentano sovrapposizioni lessicali con la catena di pensiero nativa e mostrano una struttura funzionale nel complesso simile.
Questa convalida supporta l’uso delle tracce come strumento di confronto, ma non le rende un accesso diretto ai calcoli nascosti. Il lavoro distingue esplicitamente le evidenze comportamentali dalla prova che un modello abbia generato internamente lo stesso ragionamento.
GPT-6 Astra segue un percorso più circoscritto
Il confronto principale tra modelli chiusi comprende Claude Opus 4.8, Claude Sonnet 5, GPT-5.6 Sol e GPT-6 Astra. La valutazione utilizza 80 problemi di matematica di livello competitivo, un sottoinsieme di 100 domande di Humanity’s Last Exam e un sottoinsieme di 100 domande di LiveCodeBench.
Nel set di matematica, Astra ottiene il 93,8% con il protocollo forzato, contro il 97,5% con il ragionamento nativo ad alto impegno. In Humanity’s Last Exam ottiene il 32% con il protocollo forzato contro il 35% con quello nativo, mentre su LiveCodeBench raggiunge l’89% con il protocollo forzato contro il 92% con quello nativo. Il protocollo produce quindi prestazioni vicine a quelle del ragionamento nativo, rendendo al contempo visibile un testo che i fornitori normalmente non mostrano.
Il confronto strutturale è più sorprendente del divario di accuratezza. Nei problemi di matematica, l’albero di ragionamento di Astra ha una larghezza mediana di 5, una profondità di 11 e 27 nodi. GPT-5.6 Sol registra una larghezza di 12 e 60 nodi; Claude Opus 4.8 arriva a 22 e 96 nodi; Claude Sonnet 5 raggiunge 28,5 e 136 nodi.
La profondità dell’albero misura il passaggio di ragionamento occupato più lontano, mentre la larghezza rappresenta la massima espansione laterale e il numero di nodi indica il totale dei nodi di ragionamento. Una profondità simile, ma una larghezza e dimensioni inferiori, suggerisce che Astra segue percorsi risolutivi altrettanto profondi con meno deviazioni.
Più breve non significa meno capace
I ricercatori rilevano che i modelli ricorrono a categorie di attività nel complesso simili, tra cui lettura, analisi, pianificazione, implementazione, esplorazione, verifica e monitoraggio. La differenza principale riguarda quanto di questo lavoro rendono esplicito e come lo organizzano.
Astra spesso comprime controlli aritmetici, trasformazioni algebriche e fatti noti in brevi enunciati. Il lavoro descrive tracce che omettono articoli, verbi ausiliari e punteggiatura, usando frammenti e frasi telegrafiche per codificare conclusioni intermedie. Lo stile sembra ottimizzato per trasferire informazioni in modo conciso, anziché fornire una spiegazione pienamente articolata per un lettore umano.
Tra i sistemi studiati, il modello produce anche le tracce più brevi e meno comprimibili. Gli autori usano la compressione senza perdita zlib come misura approssimativa della ridondanza: un rapporto più alto tra testo compresso e originale indica un testo con meno schemi ripetuti o prevedibili. Astra ha il rapporto più alto in tutti e tre i gruppi di benchmark, pur producendo meno token in uscita.
I risultati non dimostrano che Astra esegua meno operazioni di ragionamento. Lo studio afferma invece che il modello sembra risolvere internamente i passaggi elementari ed esplicitare decisioni e verifiche di livello superiore. La traccia visibile è scarna, ma i ricercatori individuano un repertorio complessivo simile di attività di ragionamento.
Le tracce compresse pongono un problema ai modelli meno capaci
Il gruppo verifica anche se un modello riesca a usare il ragionamento estratto da un altro modello. Ogni modello destinatario riceve la traccia di un modello donatore senza la risposta finale e deve risolvere il problema senza strumenti né ragionamento nativo.
Le tracce di Sol e Opus si trasferiscono ai modelli destinatari testati con perdite minime. Quelle di Astra si comportano diversamente: i modelli destinatari più capaci recuperano quasi tutta l’accuratezza di Astra, mentre i sistemi meno capaci ne recuperano una quota inferiore. Gli scarti maggiori si osservano con Claude Haiku 4.5 e GPT-5.4 Nano.
In alcuni casi, una traccia indica la risposta corretta e il modello destinatario restituisce comunque una risposta diversa. Il risultato suggerisce che una traccia di ragionamento compatta possa essere al di là delle capacità del modello che la legge. Un modello studente potrebbe aver bisogno dei passaggi intermedi omessi da un modello insegnante più capace.
Gli autori non testano direttamente la distillazione dopo l’addestramento, quindi lo studio non dimostra che la compressione determini uno specifico risultato di addestramento. L’esperimento misura il riutilizzo in contesto e le tracce dei modelli donatori differiscono per correttezza, contenuto e stile. Gli autori propongono una verifica successiva: espandere una traccia compressa dovrebbe aiutare i modelli destinatari meno capaci più di quelli più capaci.
Che cosa non dimostra il protocollo
Le implicazioni dello studio per la sicurezza sono limitate dai requisiti di accesso. Il metodo richiede un’API che supporti strumenti personalizzati e la selezione forzata di uno strumento con nome specifico; i sistemi privi di questi controlli non rientrano nel suo ambito. I ricercatori affermano che tutti gli esperimenti di estrazione hanno utilizzato benchmark pubblici innocui e non hanno preso di mira dati personali, prompt proprietari, credenziali o contenuti non sicuri.
Il lavoro afferma che i ricercatori hanno comunicato le loro osservazioni via email ai team di sicurezza di OpenAI e Anthropic e hanno fornito il codice per riprodurre la procedura. Nota inoltre che il protocollo può esporre contenuti simili a ragionamenti anche quando un fornitore dichiara zero token di ragionamento o disattiva una modalità di ragionamento dedicata.
La distinzione è importante. Il lavoro mostra che i controlli sul canale ufficiale di ragionamento di un modello non impediscono necessariamente la comparsa di testo intermedio in un altro campo dell’API. Non dimostra che il testo sia la catena di pensiero privata del modello, né che ogni traccia esposta rappresenti fedelmente i calcoli alla base della risposta finale.
Il risultato concreto è più circoscritto e utile: tra i sistemi testati, GPT-6 Astra raggiunge profondità di soluzione simili con una struttura visibile molto più piccola e diretta, mentre la stessa compressione rende le sue tracce più difficili da usare per i modelli meno capaci.