Vai al contenuto
AI.info

The Pulse

Redwood rileva miglioramenti di GPT-6 Astra grazie ai token riempitivi

Redwood Research riferisce che GPT-6 Astra risponde con maggiore precisione ad alcuni compiti di ragionamento quando i prompt contengono token riempitivi privi di significato. I ricercatori avvertono che questi miglioramenti sollevano inter

Redwood rileva miglioramenti di GPT-6 Astra grazie ai token riempitivi

AI.info Team ·

«Penso che i vostri risultati rispecchino probabilmente, in parte, il fatto che Astra non venga sollecitato abbastanza.»

Neel Nanda, in un commento al post di Redwood Research

I test di Redwood Research del 23 settembre hanno rilevato che GPT-6 Astra spesso risolve i problemi più difficili con maggiore accuratezza quando il prompt include token privi di informazioni pertinenti, come punti, sequenze di conteggio o ripetizioni della domanda. Al modello è stato chiesto di rispondere subito, senza ragionare. Nelle domande su fatti naturali che richiedevano quattro passaggi, l’accuratezza è salita da circa il 10–20% senza riempitivi a circa il 50% con i riempitivi.

Il risultato indica una discrepanza tra ciò che un modello riesce a elaborare e ciò che mostra nel suo ragionamento scritto. I ricercatori di Redwood — Dylan Xu, Sebastian Prasanna e Alek Westover — affermano che questi miglioramenti complicano gli sforzi per valutare i modelli monitorando la loro catena di pensiero. Non dimostrano che Astra stia nascondendo un piano dannoso; i test misurano l’accuratezza delle risposte con prompt concepiti per sopprimere il ragionamento visibile.

Punti e domande ripetute migliorano i punteggi

Il team ha testato GPT-6 Astra su domande fattuali multi-hop, problemi di aritmetica generati e problemi di competizioni matematiche, oltre che su Humanity’s Last Exam e LiveBench. Negli esperimenti principali, il riempitivo consisteva di solito in punti aggiunti dopo la domanda. Altri test usavano sequenze di conteggio o ripetevano la domanda, e gli autori affermano che i metodi hanno prodotto risultati sostanzialmente simili.

Nel compito sui fatti naturali, ogni domanda richiede di collegare informazioni attraverso diversi passaggi. L’accuratezza di Astra è aumentata man mano che i ricercatori incrementavano la quantità di riempitivo, mentre gli altri modelli testati hanno generalmente ottenuto miglioramenti minori. Redwood ha inoltre rilevato che il riempitivo ha migliorato le prestazioni di Astra in alcuni test più ampi, compresi i problemi AIME meno recenti, dove l’accuratezza è salita da circa il 60–70% a circa il 90%.

Il test blocca il ragionamento visibile, non il calcolo

Redwood ha chiesto ad Astra di non ragionare e ha richiesto una risposta di una sola riga. Poiché l’API non offriva per Astra un’impostazione «nessun ragionamento», i ricercatori hanno usato un basso livello di sforzo di ragionamento e hanno controllato il conteggio dei token di ragionamento riportato dall’API; affermano che tutti gli output inclusi riportavano zero. Questo protocollo avvalora una conclusione più circoscritta di quanto possa suggerire l’espressione «ragionamento nascosto»: il riempitivo ha migliorato le prestazioni senza una spiegazione visibile, ma l’esperimento non mostra esattamente come il modello abbia usato quei token.

Gli autori collegano il risultato al monitoraggio della catena di pensiero, una pratica di sicurezza che esamina il ragionamento scritto di un modello alla ricerca di segnali di comportamenti indesiderati. Se un modello riesce a compiere progressi significativi senza riportare quel processo nella propria spiegazione, una risposta dall’aspetto impeccabile può rivelare meno sul modo in cui è giunto alla conclusione. Redwood sostiene che le valutazioni concepite per misurare le prestazioni senza ragionamento dovrebbero testare prompt con riempitivi, anziché considerare un punteggio ottenuto senza riempitivi come misura completa delle capacità del modello.

Il formato del prompt resta una variabile da considerare

Il commento di Nanda al post propone una spiegazione alternativa: Astra potrebbe essere «sollecitato troppo poco», ovvero il prompt potrebbe non far emergere le sue capacità già esistenti. Ha affermato che, nel suo test multi-hop, un formato più chiaro e dieci esempi hanno annullato gran parte dei miglioramenti dovuti al riempitivo. Nei dati che ha condiviso, con un particolare formato di prompt e dieci esempi il punteggio è passato da 32,5 a 37 con i punti, un aumento che ha descritto come non statisticamente significativo.

L’appendice di Redwood riporta che il prompting a dieci esempi ha attenuato i miglioramenti di Astra ottenuti con il riempitivo, anche se, secondo gli autori, Astra ha comunque migliorato più dei modelli di confronto. I risultati mostrano dunque una forte sensibilità al riempitivo nelle configurazioni testate, non una spiegazione definitiva del motivo per cui si verifica o della sua applicabilità più generale. Nel test di Redwood a quattro passaggi, il cambiamento riportato è concreto: l’accuratezza è passata da circa il 10–20% senza riempitivi a circa il 50% con i riempitivi.

Fonte

Esplora

Altri articoli