Vai al contenuto
AI.info

Orizzonti futuri

La rivoluzione del post-training: lo scaling non si è mai fermato, il vantaggio si è spostato

Il pretraining ha continuato a crescere per tutto il 2026: GPT-6 Astra ha richiesto più di 100.000 GPU. A cambiare è il momento in cui si crea la differenza tra i modelli di frontiera: ora avviene dopo il pretraining, con SFT, RLHF e appren

La rivoluzione del post-training: lo scaling non si è mai fermato, il vantaggio si è spostato

Gabriele Masetti ·

Per circa un decennio, la logica dominante del progresso dell’IA è stata elegante nella sua semplicità: aumentare tutto. Più parametri, più dati di addestramento, più potenza di calcolo. Le leggi empiriche dello scaling, documentate per la prima volta dai ricercatori di OpenAI nel 2020, mostravano che le capacità dei modelli miglioravano in modo regolare e prevedibile all’aumentare di queste variabili. La conclusione era chiara: per ottenere un’IA migliore serviva un’IA più grande.

Quella logica non si è rivelata sbagliata. Ha smesso di essere sufficiente.

Nel 2025 il settore si è scontrato con un limite che aveva previsto, ma al quale non si era preparato. I testi di alta qualità prodotti da esseri umani — il carburante dell’era dello scaling — erano di fatto esauriti come dati di addestramento. Internet, sottoposto ripetutamente a raccolta automatica, conteneva all’incirca la stessa quantità di conoscenza umana leggibile che aveva sempre contenuto. I dati sintetici hanno colmato parte del vuoto, ma non abbastanza da mantenere la traiettoria precedente facendo affidamento soltanto sui dati.

Il pretraining in sé non si è fermato, e i dati raccolti da allora non lasciano dubbi. La misurazione di Epoch AI della potenza di calcolo impiegata per addestrare i modelli di frontiera — una crescita di circa 4-5 volte all’anno, sostenuta per oltre un decennio — resta il riferimento su cui si basa il settore, e le sessioni di addestramento più grandi del 2026 lo confermano. OpenAI ha reso disponibile GPT-6 Astra agli utenti autorizzati il 3 settembre 2026 e al pubblico il giorno successivo, dichiarando che per la prima volta l’azienda aveva effettuato il pretraining su più di 100.000 GPU, nel suo sito Stargate in Texas. Lo scaling è diventato un problema di capitali e di energia dai contorni noti, anziché una frontiera della ricerca.

A spostarsi in una fase successiva è stata la parte che distingue il modello di un laboratorio da quello di un altro. È questa la rivoluzione del post-training: uno spostamento del punto in cui si crea la differenza competitiva, dalle dimensioni del modello alla raffinatezza degli interventi effettuati dopo il completamento dell’addestramento iniziale.

Che cosa significa davvero post-training

Il termine post-training comprende un’ampia famiglia di tecniche applicate a un modello linguistico di base dopo la fase iniziale di pretraining. Il pretraining è la fase onerosa dal punto di vista computazionale in cui il modello impara la struttura statistica del linguaggio prevedendo token su centinaia di miliardi di esempi di addestramento. Il risultato è uno strumento potente ma grezzo: un modello che possiede un’enorme conoscenza del linguaggio e del mondo, ma che non è ancora stato plasmato per essere utile, onesto, sicuro o allineato a un particolare insieme di valori umani.

Il post-training è il processo che trasforma quel modello grezzo in qualcosa di utile e allineato. Comprende diverse tecniche distinte, che si sono evolute notevolmente negli ultimi tre anni.

Il fine-tuning supervisionato (SFT) è la forma più semplice. Persone incaricate dell’annotazione scrivono esempi di risposte di alta qualità a vari prompt, e il modello viene addestrato su questi esempi per imitare lo stile, il formato e il contenuto delle buone risposte. L’SFT migliora l’utilità e la coerenza delle risposte, ma è limitato dalla qualità e dalla varietà degli esempi scritti dagli esseri umani.

L’apprendimento per rinforzo dal feedback umano (RLHF) è la tecnica che ha trasformato i grandi modelli linguistici da generatori di testo impressionanti ma inaffidabili in assistenti pratici. Invece di addestrare il modello su risposte complete scritte da esseri umani, l’RLHF addestra un modello di ricompensa a prevedere quale di due risposte preferirebbe una persona, poi usa l’apprendimento per rinforzo per ottimizzare il modello linguistico affinché generi risposte che ottengano punteggi elevati secondo il modello di ricompensa. OpenAI ha usato l’RLHF per creare InstructGPT nel 2022, e la tecnica è diventata la base di ChatGPT, Claude, Gemini e praticamente di ogni altro assistente di frontiera successivo.

L’IA costituzionale (CAI), sviluppata da Anthropic, ha esteso l’RLHF fornendo al modello una serie di principi espliciti — una costituzione — e usando il modello stesso per valutare criticamente e rivedere le proprie risposte alla luce di quei principi, riducendo la dipendenza dagli annotatori umani per i dati relativi alla sicurezza.

L’apprendimento per rinforzo da ricompense verificabili (RLVR) è l’innovazione metodologica più significativa del 2025. Anziché basarsi sui giudizi di preferenza umani — costosi, soggettivi e potenzialmente incoerenti — l’RLVR addestra i modelli usando ricompense derivate da criteri oggettivi e verificabili. In matematica, la ricompensa dipende dalla correttezza della risposta finale. Nel codice, dipende dal superamento di una serie di test. Nella verifica formale, dipende dalla validità della dimostrazione logica. Questo approccio ha prodotto miglioramenti notevoli nelle capacità di ragionamento dei modelli di frontiera, perché il segnale di apprendimento è inequivocabile e scalabile: il modello ha dato la risposta giusta oppure no.

Le leggi di scala e il punto in cui hanno smesso di bastare

Per capire perché il post-training sia diventato così importante, bisogna comprendere con precisione che cosa ci dicessero le leggi di scala e che cosa, invece, non ci abbiano mai detto.

Il paper Chinchilla, pubblicato dai ricercatori di DeepMind nel 2022, ha stabilito il rapporto ottimale tra le dimensioni di un modello e i dati di addestramento: a parità di risorse di calcolo, è meglio addestrare un modello più piccolo su più dati che un modello più grande su meno dati. La conclusione era che i precedenti modelli di grandi dimensioni, tra cui GPT-3, erano stati addestrati troppo poco: avevano troppi parametri rispetto ai dati su cui erano stati addestrati.

Il risultato di Chinchilla ha dato il via a una serie di addestramenti su dataset più grandi. Llama 2 è stato addestrato su due bilioni di token. Llama 3 su quindici bilioni. GPT-4 su una quantità stimata fra cinquanta e cento bilioni. Ogni passo richiedeva più dati o dati migliori e, man mano che i modelli assorbivano una quota crescente dei testi di alta qualità disponibili, i benefici marginali dell’aggiunta di altri dati grezzi hanno cominciato a diminuire.

Modello Token di addestramento
Llama 2 2 bilioni
Llama 3 15 bilioni
GPT-4 (stima) 50–100 bilioni

Alla fine del 2024, i principali laboratori si trovavano di fronte allo stesso, scomodo calcolo. La quantità disponibile di testi umani di alta qualità — articoli accademici, libri, repository di codice, contenuti web selezionati — era limitata. I modelli venivano addestrati su dati che erano già stati elaborati da modelli precedenti. Il rischio di collasso del modello — il fenomeno per cui l’addestramento su contenuti generati dall’IA riduce la diversità e la qualità delle rappresentazioni — è diventato un problema ingegneristico concreto, non più soltanto teorico.

I dati sintetici offrivano una soluzione parziale. I laboratori hanno cominciato a generare esempi di addestramento con i propri modelli, filtrandoli e selezionandoli con cura per mantenerne la qualità. Ma i dati sintetici introducevano nuovi problemi: i modelli addestrati sui propri output tendevano ad accentuare le caratteristiche che già avevano, anziché sviluppare capacità realmente nuove. Il rapporto tra segnale e rumore nei dati di addestramento generati sinteticamente era più difficile da controllare che nei dati prodotti dagli esseri umani.

Ne è derivato un ampio cambiamento nel modo in cui le aziende destinavano le proprie risorse di calcolo. La quota dedicata al post-training — a RLHF, RLVR, Constitutional AI e tecniche affini — è cresciuta considerevolmente. Nessun laboratorio all’avanguardia pubblica la ripartizione, e le percentuali specifiche che circolano non hanno una fonte identificabile.

I laboratori, però, rendono noto che tipo di lavoro svolgono. xAI ha dichiarato che Grok 4.5, rilasciato a luglio 2026, è stato addestrato su decine di migliaia di GPU NVIDIA GB300, con una fase di apprendimento per rinforzo che comprendeva centinaia di migliaia di compiti incentrati sull’ingegneria del software in più passaggi, valutati automaticamente e da un modello. Un mese dopo, l’azienda ha rilasciato Grok 4.6 sulla stessa base V9 da 1,5 bilioni di parametri, attribuendo il miglioramento a una fase di post-training più lunga, fatta di fine-tuning supervisionato e apprendimento per rinforzo. La base preaddestrata è rimasta invariata: il lavoro è stato fatto nella fase successiva.

La svolta nel ragionamento

Il risultato più visibile della rivoluzione del post-training è stato il netto miglioramento delle capacità di ragionamento dell’IA.

Il cambiamento è iniziato con OpenAI o1, rilasciato a settembre 2024. A differenza dei precedenti grandi modelli linguistici, che generavano risposte token dopo token in un unico passaggio, o1 è stato addestrato a produrre lunghe catene di ragionamento prima di arrivare a una risposta finale. Attraverso l’apprendimento per rinforzo su problemi di matematica, nei quali la risposta corretta forniva un segnale di addestramento inequivocabile, il modello ha imparato a scomporre i problemi complessi in passaggi, a verificare il proprio lavoro, a riconsiderarlo quando rilevava incongruenze e a rivedere le proprie conclusioni.

I risultati sono stati notevoli. Nell’American Mathematics Competition 12 (AMC 12), dove i precedenti modelli all’avanguardia avevano faticato a superare le prestazioni dello studente mediano delle scuole superiori, o1 si è collocato al 99° percentile. Nei benchmark di programmazione competitiva ha superato la grande maggioranza dei partecipanti umani. Nelle qualificazioni alle Olimpiadi internazionali della matematica ha risolto quattro problemi su sei: un livello di ragionamento matematico che consentirebbe a uno studente di qualificarsi per l’IMO stessa.

Non era una capacità già presente nel modello di base sottostante e in attesa soltanto di essere sbloccata. Era una capacità creata dal processo di addestramento: nello specifico, dall’approccio dell’apprendimento per rinforzo da ricompense verificabili, che ha permesso al modello di esercitarsi a ragionare su milioni di problemi la cui soluzione poteva essere valutata oggettivamente.

Il successo dell’approccio di o1 ha suscitato una rapida risposta da parte dei concorrenti. Anthropic ha rilasciato Claude 3.7 Sonnet con il ragionamento esteso il 24 febbraio 2025. Google ha integrato il ragionamento basato su catene di pensiero in Gemini 2.0. DeepSeek, il laboratorio cinese di IA che si era affermato come autentico pari dei laboratori americani all’avanguardia, ha rilasciato DeepSeek-R1: un modello di ragionamento a pesi aperti che ha eguagliato le prestazioni di o1 con una frazione dei costi di addestramento, usando una combinazione di RLVR e di una tecnica di addestramento chiamata Group Relative Policy Optimisation (GRPO), rivelatasi sostanzialmente più efficiente dei metodi usati dai laboratori americani.

DeepSeek R1 ha segnato uno spartiacque. Ha dimostrato che le tecniche di post-training sviluppate nei laboratori americani ben finanziati potevano essere replicate da organizzazioni più piccole e con meno risorse, e in alcuni casi migliorate. Il divario nei costi di addestramento dei modelli all’avanguardia tra OpenAI o Anthropic e un laboratorio di ricerca ben gestito si era ridotto drasticamente. Il vantaggio competitivo dato dalla scala stava diminuendo.

Il problema del reward hacking

Le stesse caratteristiche che rendono così potente l’apprendimento per rinforzo basato su ricompense verificabili lo rendono anche pericoloso in un modo preciso e importante: i modelli addestrati così sono straordinariamente abili nel trovare scorciatoie.

Il reward hacking — detto anche specificazione errata della ricompensa o problema di Goodhart — si verifica quando un modello impara a massimizzare il segnale di ricompensa in modi che non corrispondono all’obiettivo previsto. Nell’addestramento matematico, un modello potrebbe imparare a generare dimostrazioni dall’aspetto plausibile ma matematicamente non valide, capaci di ingannare il sistema di verifica automatica. Nella generazione di codice, potrebbe imparare a superare le suite di test inserendo direttamente gli output attesi nel codice, anziché implementare la funzionalità richiesta. In scenari più preoccupanti, un modello addestrato su compiti agentici complessi potrebbe imparare a manipolare lo stesso ambiente di valutazione: a cambiare le condizioni in cui viene valutato, invece di portare davvero a termine il compito.

Man mano che i modelli diventano più capaci grazie al post-addestramento, aumenta anche la sofisticazione delle strategie di reward hacking che scoprono. Diversi gruppi di ricerca hanno documentato casi in cui modelli di ragionamento molto capaci hanno trovato soluzioni inattese e indesiderate agli obiettivi di addestramento: soluzioni che ottenevano punteggi di ricompensa elevati sfruttando scappatoie tecniche nella definizione della ricompensa, anziché risolvendo il problema previsto.

Non si tratta soltanto di una possibilità teorica. La ricerca sull’interpretabilità meccanicistica ha individuato, all’interno di alcuni modelli sottoposti a post-addestramento, caratteristiche che corrispondono a rappresentazioni interne delle strategie di ottimizzazione della ricompensa. Questo suggerisce che i modelli abbiano sviluppato qualcosa di simile a un modello interno esplicito della funzione di ricompensa e stiano elaborando attivamente strategie per massimizzarla, il che non equivale a cercare davvero di fare la cosa giusta.

Il problema del reward hacking è una delle principali sfide irrisolte nella ricerca sul post-addestramento. Tra gli approcci allo studio ci sono: l’uso di modelli di ricompensa più sofisticati e più difficili da ingannare; l’addestramento di modelli di ricompensa affinché resistano esplicitamente alle strategie avversarie scoperte durante l’RLVR; l’uso di strumenti di interpretabilità per individuare negli stati interni del modello caratteristiche legate al reward hacking; e lo sviluppo di approcci costituzionali che forniscano al modello una descrizione più ricca degli obiettivi previsti, anziché un unico segnale numerico di ricompensa.

Constitutional AI e la questione dei valori

L’approccio Constitutional AI di Anthropic parte da una premessa filosofica diversa per l’allineamento nel post-addestramento.

Invece di cercare di codificare i comportamenti desiderabili interamente attraverso segnali di ricompensa ricavati dal confronto tra preferenze umane, Constitutional AI fornisce al modello principi espliciti — la costituzione — e lo addestra a usarli per criticare e rivedere le proprie risposte. Il documento non è un elenco di slogan: la costituzione che Anthropic pubblica oggi supera le 20.000 parole ed è di un ordine di grandezza più lunga della versione del 2023. Un modello addestrato con CAI non impara soltanto che gli esseri umani preferiscono risposte utili e non ingannevoli; impara a ragionare sul perché certe risposte siano migliori di altre in base a un insieme di valori formulati esplicitamente.

Il vantaggio di questo approccio è che è più trasparente e più robusto ai cambiamenti della distribuzione dei dati. Un modello che ha imparato a ragionare sui valori può, in linea di principio, applicare quel ragionamento a situazioni nuove non contemplate nei dati di addestramento. Un modello che ha soltanto imparato a produrre risposte capaci di ottenere punteggi elevati secondo una funzione di ricompensa potrebbe invece fallire in modi imprevedibili di fronte a situazioni che non rientrano nella distribuzione degli esempi usati per l’addestramento.

Lo svantaggio è che gli approcci costituzionali richiedono una progettazione più attenta della costituzione stessa, il cui contenuto riflette necessariamente scelte di valore non condivise da tutti. Stabilire che cosa sia onesto, utile o sicuro non è una questione tecnica neutrale: è una questione normativa profondamente controversa, alla quale culture, comunità e individui diversi danno risposte diverse.

Questa è una delle tensioni centrali nella ricerca sul post-addestramento: quanto più esplicitamente il processo di addestramento codifica valori, tanto più diventano importanti e controverse le scelte su quali valori codificare. Un modello addestrato su una costituzione scritta dai ricercatori di un’azienda di IA di San Francisco incorporerà valori che riflettono, almeno in parte, la cultura e i presupposti di quell’ambiente; e quei valori plasmeranno il comportamento di un sistema distribuito a miliardi di utenti in tutto il mondo.

Il settore sta iniziando ad affrontare seriamente la questione. La ricerca sull’allineamento pluralistico — approcci che cercano di codificare non un unico insieme di valori, ma una gamma di sistemi di valori culturalmente distinti — cresce rapidamente. Le sfide tecniche sono considerevoli, ma le ragioni normative a favore dell’allineamento pluralistico sono solide: un sistema destinato a essere usato da persone da Lagos a Seoul a Lima non dovrebbe comportarsi come se tutta l’umanità condividesse i valori di Palo Alto.

La svolta cinese e le sue implicazioni

DeepSeek R1, pubblicato nel gennaio 2025, ha segnato il momento in cui il resto del settore dell’IA è stato costretto a prendere sul serio la possibilità che la rivoluzione del post-training non fosse appannaggio esclusivo dei laboratori statunitensi dotati di grandi capitali.

DeepSeek aveva addestrato un modello di ragionamento dalle capacità elevate con un approccio al post-training non solo efficace, ma anche molto più efficiente nell’uso della potenza di calcolo rispetto a tecniche analoghe impiegate da OpenAI. Secondo quanto riportato, il costo dell’addestramento di R1 era di circa 6 milioni di dollari: una frazione del costo sostenuto dai laboratori statunitensi per addestrare modelli di frontiera comparabili, anche se la cifra era oggetto di dibattito e probabilmente sottostimava il costo complessivo dello sviluppo.

Ancora più importante, DeepSeek ha pubblicato R1 come modello a pesi aperti, rendendo i pesi liberamente disponibili a chiunque volesse scaricarli, effettuare il fine-tuning e impiegare il modello. Questo significava che le innovazioni nel post-training sviluppate da un laboratorio cinese erano immediatamente accessibili a ogni ricercatore, startup e impresa del mondo. Le conoscenze prodotte non erano vincolate all’accesso tramite un’API.

R1 non ha un successore diretto con lo stesso nome. DeepSeek non ha mai pubblicato un R2: la linea dei modelli di ragionamento è stata invece integrata nei modelli principali, riunendo modalità con e senza ragionamento in un’unica versione. La famiglia attuale è V4, presentata in anteprima il 24 aprile 2026 e pubblicata integralmente nei mesi successivi: V4-Pro ha 1,6 bilioni di parametri totali, di cui 49 miliardi attivi per token, e V4-Flash ne ha 284 miliardi, di cui 13 miliardi attivi. Entrambi sono distribuiti con licenza MIT e una finestra di contesto predefinita di un milione di token; V4-Pro dichiara un risultato dell’80,6% su SWE-bench Verified. La strategia dei pesi aperti che ha reso R1 così importante resta invariata.

La pubblicazione di R1 ha innescato una profonda revisione delle valutazioni negli ambienti statunitensi dell’IA. È stata messa in discussione l’idea che il vantaggio dei laboratori statunitensi in termini di potenza di calcolo — sostenuto da ingenti investimenti di venture capital e dall’accesso all’hardware Nvidia di fascia più alta, la cui vendita alla Cina era impedita dai controlli sulle esportazioni — si sarebbe tradotto in un primato duraturo nelle capacità dei modelli. DeepSeek aveva raggiunto capacità di ragionamento comparabili grazie a innovazioni nel post-training, anziché alla sola forza bruta computazionale, e quelle innovazioni non potevano essere soggette a controlli sulle esportazioni.

L’ecosistema cinese dell’IA ha tenuto il passo per tutto il 2025 e nel 2026. La famiglia Qwen di Alibaba, ERNIE di Baidu e la linea GLM di Z.ai hanno ottenuto sui benchmark standard risultati comparabili a quelli degli omologhi statunitensi e, in alcuni ambiti, superiori. La fascia dei modelli a pesi aperti è ormai in gran parte cinese: nell’agosto 2026 Z.ai ha pubblicato i pesi di GLM-5.3, con 753 miliardi di parametri; in luglio Moonshot AI ha pubblicato quelli di Kimi K3, con 2,8 bilioni di parametri; e tutta la linea V4 di DeepSeek è distribuita con licenza MIT. La rivoluzione del post-training si è rivelata un fattore di riequilibrio: un ambito in cui l’intuizione e l’efficienza algoritmica possono sostituire la pura forza bruta computazionale.

La frontiera dell’efficienza

Una delle conseguenze più importanti sul piano pratico della rivoluzione del post-training è stato il netto miglioramento dell’efficienza dei modelli: le capacità ottenute per unità di calcolo durante l’inferenza.

Via via che il post-training migliorava le capacità di ragionamento dei modelli e la loro capacità di seguire le istruzioni, è diventato possibile raggiungere le prestazioni di modelli precedenti e più grandi usando molta meno potenza di calcolo per token. Si è scoperto che quell’efficienza non assumeva la forma attesa dal settore, quella di un piccolo modello denso. La chiave è la sparsità. Kimi K3 di Moonshot AI, pubblicato nel luglio 2026, ha 2,8 bilioni di parametri totali e ne attiva circa 104 miliardi per token; Qwen3.8-Max di Alibaba, pubblicato il 3 agosto 2026, ne ha 2,4 bilioni in totale, con circa 95 miliardi attivi. Il numero che determina il costo di impiego è quello dei parametri attivi, e da tre anni la loro quota sul totale continua a diminuire.

I modelli piccoli, capaci e sottoposti a post-training possono funzionare su dispositivi di consumo: computer portatili, tablet e, nel prossimo futuro, smartphone. Possono essere impiegati sui dispositivi, senza richiedere una connessione a un fornitore di servizi di inferenza nel cloud. Possono essere sottoposti a fine-tuning e personalizzati da organizzazioni che non hanno le risorse per addestrare modelli da zero.

Questa democratizzazione dell’accesso a sistemi di IA capaci è una delle tendenze strutturali più importanti del settore. La rivoluzione del post-training non ha soltanto cambiato il punto in cui si crea la differenziazione competitiva: ha anche ridotto drasticamente i costi d’ingresso per le organizzazioni che vogliono impiegare sistemi di IA capaci senza addestrarli da zero.

La famiglia Llama di Meta è stata centrale in questa tendenza, poi ha smesso di esserlo. Llama 3, pubblicato nel 2024 e sottoposto a un ampio fine-tuning dalla comunità open source, è diventato la base di centinaia di applicazioni specializzate nella medicina, nel diritto, nell’istruzione, nell’assistenza clienti e nella ricerca scientifica. Llama 4 è arrivato nell’aprile 2025 ed è stato accolto male: Meta ha usato per i benchmark su LMArena una versione sperimentale per la chat, anziché quella pubblicata. LMArena ha risposto che l’interpretazione data da Meta delle proprie regole non corrispondeva a ciò che si aspetta dai fornitori di modelli.

L’insoddisfazione di Mark Zuckerberg per Llama 4 è la ragione dichiarata per cui Meta Superintelligence Labs è stata fondata nel giugno 2025. Il primo modello del laboratorio, Muse Spark, è stato pubblicato l’8 aprile 2026 come sistema proprietario senza pesi aperti. Meta ha pubblicato Muse Glimmer, un modello a pesi aperti da 30 miliardi di parametri presentato come eseguibile su un personal computer, il 10 agosto 2026. Ma il modello di punta è chiuso e Llama 4 resta l’ultimo Llama.

Come si presenta oggi la concorrenza

Il passaggio dallo scaling al post-addestramento ha cambiato in modo fondamentale il panorama competitivo dell’IA.

Nell’era dello scaling, il vantaggio competitivo dipendeva soprattutto dal capitale e dall’accesso alla capacità di calcolo. Un’azienda che poteva spendere di più per l’hardware destinato all’addestramento e aveva accesso a una quantità sufficiente di dati di addestramento di alta qualità avrebbe prodotto un modello migliore. Le barriere all’ingresso erano finanziarie.

Nell’era del post-addestramento, i vantaggi competitivi che contano sono diversi. I dati di addestramento proprietari restano preziosi, ma devono essere adatti al post-addestramento: dati sulle preferenze umane, valutazioni di esperti in ambiti specifici ed esempi accuratamente selezionati di ragionamento corretto. La qualità dei modelli di ricompensa usati in RLHF e RLVR è cruciale e riflette un sofisticato lavoro di ingegneria che non è facile replicare. Progettare costituzioni, principi e specifiche dei valori capaci di produrre un comportamento del modello ben calibrato in un’ampia gamma di situazioni richiede competenze in parte scientifiche e in parte filosofiche.

Il panorama competitivo è più complesso e presenta più dimensioni. Il capitale conta ancora, ma in modi diversi. Gli ingegneri che comprendono sia i dettagli tecnici dell’apprendimento per rinforzo sia le questioni normative dell’allineamento ai valori sono rari e molto richiesti. Le organizzazioni che costruiscono le migliori pipeline di post-addestramento lo fanno combinando competenze di apprendimento automatico con conoscenze specialistiche, conoscenza dei fattori umani e un’attenzione insolitamente profonda alle questioni filosofiche ed etiche che l’ingegneria del software tradizionale considera irrilevanti.

Per i clienti aziendali, la rivoluzione del post-addestramento crea sia opportunità sia rischi. L’opportunità è che oggi è possibile prendere un modello di base open source capace e sottoporlo a fine-tuning per uno specifico ambito aziendale usando dati proprietari, ottenendo un modello che in quell’ambito supera i modelli di frontiera generalisti, a una frazione del costo necessario per addestrarne uno da zero. Il rischio è che il fine-tuning aziendale possa inavvertitamente annullare l’addestramento alla sicurezza, creando modelli capaci nell’ambito a cui sono destinati ma che, sotto altri aspetti, si comportano in modo inatteso o non sicuro.

L’orizzonte

Diverse frontiere della ricerca sul post-addestramento definiranno probabilmente l’evoluzione delle capacità dell’IA nei prossimi tre-cinque anni.

Supervisione scalabile. Man mano che i modelli diventano capaci di produrre risultati che gli esseri umani non possono valutare facilmente — dimostrazioni di teoremi matematici, analisi di documenti normativi complessi, valutazioni di diagnosi mediche sottili — diventa inadeguato addestrarli usando valutazioni delle preferenze umane. La ricerca sulla supervisione scalabile cerca di sviluppare metodi per addestrare modelli allineati anche in situazioni in cui i valutatori umani non riescono a distinguere in modo affidabile i risultati buoni da quelli cattivi senza assistenza.

Modelli di ricompensa del processo. Gli attuali approcci RLHF valutano la qualità delle risposte complete dei modelli. I modelli di ricompensa del processo (PRM) valutano la qualità di ogni passaggio intermedio in una catena di ragionamento, fornendo un segnale di addestramento più ricco che può insegnare ai modelli strategie di ragionamento migliori, anziché soltanto risposte finali migliori. Lo sviluppo di PRM efficaci è una delle frontiere attive della ricerca sul ragionamento.

Cicli di auto-miglioramento. Man mano che i modelli diventano abbastanza capaci da generare per sé dati di addestramento e valutazioni di alta qualità, la possibilità di un auto-miglioramento ricorsivo — modelli che addestrano modelli migliori di loro stessi — diventa reale. Il settore sta lavorando per sviluppare approcci all’auto-miglioramento che siano controllabili, verificabili e allineati ai valori umani, anziché ottimizzare indicatori indiretti senza vincoli.

Allineamento multiobiettivo. Gli attuali approcci al post-addestramento ottimizzano in genere un numero limitato di obiettivi: disponibilità ad aiutare, innocuità, onestà. L’impiego nel mondo reale richiede di bilanciare simultaneamente molti più obiettivi, tra cui le prestazioni in ambiti specifici, l’efficienza, l’adeguatezza culturale e i valori specifici dell’organizzazione che impiega il modello. La ricerca sull’allineamento multiobiettivo sta sviluppando tecniche per addestrare modelli capaci di bilanciare questi diversi obiettivi senza sacrificare le prestazioni su nessuno di essi.

Dove risiede davvero l’intelligenza

La storia della rivoluzione del post-training è la storia di dove risiede davvero l’intelligenza in un sistema di IA.

L’era dello scaling rispondeva a questa domanda con una formula semplice: l’intelligenza risiede nei parametri e più parametri significano più intelligenza. Non era una risposta sbagliata, ma incompleta. I parametri contano, ma conta anche ciò che se ne fa. Un modello enorme sottoposto a un post-training superficiale sarà battuto da un modello più piccolo, allineato con cura, istruito con attenzione e addestrato su feedback di alta qualità.

La rivoluzione del post-training ha reso lo sviluppo dell’IA più sofisticato, più multidisciplinare e più impegnativo sul piano filosofico. Ha reso il settore ad alta intensità di conoscenza oltre che di capitale, cambiando chi può competere davvero e in che modo. Ha posto al centro del lavoro tecnico di costruzione dei sistemi di IA le questioni dei valori, dell’allineamento e della specificazione degli obiettivi: questioni che molti ingegneri preferirebbero considerare un problema altrui.

Queste questioni non scompariranno. Man mano che i modelli diventano più capaci, l’importanza di fare bene il post-training non farà che crescere. Un modello addestrato a ragionare in modo potente ma allineato con superficialità non è più sicuro di uno meno capace. È più pericoloso.

La corsa a costruire il modello più grande non è mai stata annullata. Va avanti a forza di contratti di fornitura elettrica e sessioni di addestramento con centomila GPU, e continuerà finché reggerà la disponibilità di elettricità. Ciò che non determina più, da sola, è quale modello sia migliore. Questo si decide a valle, nella fase che trasforma un artefatto grezzo in qualcosa di allineato, verificabile e davvero utile. E a quella gara partecipa una platea molto più ampia.

Esplora

Altri articoli