Orizzonti futuri
La crisi del collasso dei modelli: come l’IA divora i propri dati di addestramento
Il collasso dei modelli è reale, ma si verifica solo a certe condizioni: richiede che i dati vengano sostituiti, non accumulati. A essere cambiato è il contesto: l’obbligo di marcatura dell’UE si applica dall’agosto 2026 e il limite dei dat

Gabriele Masetti ·
Un circolo vizioso senza interruttore
Nel luglio 2024, Nature ha pubblicato un articolo dal titolo così esplicito da sembrare un’avvertenza: «I modelli di IA collassano quando vengono addestrati su dati generati ricorsivamente». Gli autori — Ilia Shumailov e Yarin Gal dell’University of Oxford, Zakhar Shumaylov e Ross Anderson dell’University of Cambridge, Yiren Zhao dell’Imperial College London e Nicolas Papernot dell’University of Toronto e del Vector Institute — hanno dato un nome a un fenomeno di cui gli addetti ai lavori parlavano sottovoce da anni: se si addestra un modello generativo sui propri output, generazione dopo generazione, il modello non si limita a ristagnare.
Dimentica attivamente. Gli eventi rari scompaiono per primi, la variabilità si riduce e, alla fine, il sistema converge verso un nucleo degenerato e ripetitivo che non somiglia più alla distribuzione dei dati da cui era partito.
La scoperta conta per il momento in cui arriva, non per la sua novità. Lo stesso gruppo ne aveva già delineato il meccanismo un anno prima, in un preprint del 2023 intitolato «La maledizione della ricorsione: l’addestramento su dati generati fa dimenticare i modelli», e i matematici sapevano da tempo che l’errore di campionamento si accumula nei processi iterati. A cambiare nel 2024 è stata la portata della crisi descritta.
Quando è uscito l’articolo su Nature, il web aperto — la base su cui viene addestrato ogni modello di base — funzionava già da quasi due anni come un contenitore in cui si mescolavano testi scritti da esseri umani e da macchine, senza un modo affidabile per distinguerli. Il collasso dei modelli ha smesso di essere una curiosità teorica sui cicli ricorsivi ed è diventato una questione concreta: l’intera filiera che produce i grandi modelli linguistici ha cominciato ad avvelenarsi da sola?
Su questo occorre essere precisi, perché la versione più diffusa della vicenda si è allontanata da ciò che l’articolo sostiene davvero. Il collasso dei modelli è reale, ben definito e riproducibile. Non dimostra, però, che i dati sintetici siano tossici per definizione, né che il settore stia correndo verso un inevitabile crollo delle capacità. L’affermazione più interessante e più solida è più circoscritta: l’addestramento ricorsivo, quando usa dati non filtrati per sostituire quelli precedenti, degrada i modelli in modo prevedibile; il meccanismo si ritrova in architetture diverse; e la risposta delle aziende e delle infrastrutture a questo rischio è, al momento, inadeguata rispetto alla portata del problema. Non perché la scienza sia poco chiara, ma perché gli incentivi a risolverlo sono deboli.
Che cos’è davvero il collasso
Shumailov e colleghi descrivono il collasso dei modelli come un processo degenerativo che si sviluppa attraverso successive generazioni di modelli, dove per «generazione» si intende un ciclo di addestramento, non una versione dell’architettura. Si prende un modello, se ne campionano gli output e li si usa — esclusivamente o prevalentemente — come dati di addestramento per il modello successivo. Poi si ripete. L’articolo su Nature individua due fonti di errore che si accumulano in questo ciclo.
L’errore di approssimazione statistica nasce dal fatto che qualsiasi campione finito tratto dalla distribuzione degli output di un modello rappresenta troppo poco le code: le scelte lessicali rare, le costruzioni sintattiche insolite e i completamenti poco probabili ma validi che rendono una distribuzione ricca anziché piatta. L’errore di approssimazione funzionale nasce invece dal fatto che il modello incaricato dell’approssimazione non è mai, già in partenza, una rappresentazione perfetta della distribuzione reale; ogni architettura ha i propri bias e punti ciechi, che vengono rafforzati anziché corretti quando un modello impara dalle ipotesi di un altro.
Ripetendo il processo abbastanza volte, i due errori si sommano. Le code della distribuzione — gli schemi poco frequenti ma reali che danno alla lingua la sua varietà — sono le prime a sparire, perché ogni generazione le campiona meno spesso della precedente e, una volta scomparse, nei dati di addestramento non resta nulla che possa recuperarle. L’articolo ha mostrato questo andamento negli autoencoder variazionali, nei modelli a miscela gaussiana e nei modelli linguistici: proprio per questo era difficile liquidare il risultato come un effetto particolare di una sola architettura.
Il meccanismo è strutturale: deriva da ciò che il campionamento ripetuto fa a una distribuzione, indipendentemente dai token o dai pixel coinvolti. Le generazioni successive non diventano ostili né si guastano in modi così evidenti che un lettore distratto se ne accorgerebbe subito: diventano piatte. Gli output si concentrano attorno ai completamenti che il modello stesso considera più probabili, la variabilità crolla e la capacità del modello di cogliere le modalità rare ma valide della distribuzione si deteriora, finché non resta che un residuo ristretto e ripetitivo dell’originale.
La vera via d’uscita: accumulare, non puntare alla purezza
La correzione più importante alla tesi del collasso non è arrivata da critici che contestavano il risultato pubblicato su Nature, ma da uno studio del 2024 che ha messo alla prova un’altra ipotesi alla base degli esperimenti originali. Matthias Gerstgrasser, Rylan Schaeffer e i loro coautori, in «Is Model Collapse Inevitable? Breaking the Curse of Recursion by Accumulating Real and Synthetic Data», hanno osservato che gli esperimenti principali di Shumailov et al. descrivevano un mondo in cui i dati sintetici di ogni generazione sostituiscono il precedente set di addestramento, anziché aggiungersi a esso.
È un’ipotesi forte e, per certi versi, artificiale. Quando Gerstgrasser e colleghi hanno invece simulato l’accumulo — aggiungendo i dati sintetici prodotti da ogni generazione al corpus originale di testi umani, anziché sostituirlo — l’errore nei test ha smesso di crescere senza limiti da un’iterazione all’altra. Si è invece stabilizzato su un valore massimo finito.
Non è una nota tecnica marginale: cambia il modo di intendere l’intera posta in gioco sul piano pratico. Se a provocare il collasso è la sostituzione, la domanda per il settore non è «si possono mai usare i dati sintetici in sicurezza?», ma «qualcuno sta davvero scartando il corpus accumulato di testi umani per sostituirlo interamente con dati sintetici?».
Nella pratica, quasi nessuno lo fa deliberatamente: i laboratori mescolano dati sintetici e dati umani, e i set di addestramento che contano, come quelli alla base dei modelli GPT, Claude e della classe di Gemini, continuano a poggiare su grandi corpus accumulati di testi umani, invece di ripartire a ogni generazione da insiemi composti soltanto da dati sintetici. Il pericolo descritto nello studio pubblicato su Nature è reale, ma condizionato a una circostanza — la sostituzione integrale anziché l’accumulo — che una pratica attenta può evitare. Il problema non sono i dati sintetici in sé; è perdere le tracce della loro provenienza al punto da non poter più garantire l’accumulo.
La distillazione è il controesempio che questa tesi ignora
La prova più solida contro l’idea che «i dati sintetici sono pericolosi» in generale è che alcuni dei modelli oggi più capaci in uso sono stati addestrati intenzionalmente e in misura sostanziale con dati sintetici, e ha funzionato. La distillazione — l’addestramento di un modello «allievo» più piccolo sulle risposte generate da un modello «insegnante» più grande e più capace — è una pratica standard proprio perché dati sintetici generati con cura da una fonte più forte possono trasferire capacità in modo efficiente.
Non è autoaddestramento ricorsivo nel senso che porta al collasso: i dati fluiscono dall’alto verso il basso, da un modello più capace a uno meno capace, anziché essere prodotti e consumati dallo stesso modello in un circuito chiuso, senza alcuna distinzione. A determinare se i dati sintetici aiutino o danneggino non è la distinzione fra sintetico e reale, ma la presenza di una differenza di qualità e di un meccanismo — selezione umana, verifica rispetto a dati accertati, filtri di correttezza — che impedisca agli errori di accumularsi senza controllo da una generazione all’altra. La distillazione ha entrambi. I semplici cicli in cui si raccolgono testi dal web e vi si riaddestra un modello senza filtrarli, di solito, non hanno né l’una né l’altro.
La scarsità di dati peggiora il problema degli incentivi
Il collasso dei modelli sarebbe un rischio circoscrivibile e ben compreso se i laboratori avessero a disposizione una quantità illimitata di testi umani puliti su cui ripiegare. Non è così, ed è questa scarsità a trasformare un rischio tecnico gestibile in un problema strutturale. Nella sua ricerca sulla crescita dei dati disponibili, esposta più compiutamente in «Will we run out of data? Limits of LLM scaling based on human-generated data», Epoch AI stima che il patrimonio effettivo di testi pubblici di qualità scritti da esseri umani e disponibili per l’addestramento, tenendo conto delle ripetizioni, sia di circa 300 bilioni di token.
Le proiezioni della stessa Epoch AI sul momento in cui quel patrimonio sarà interamente utilizzato sono cambiate nel tempo, con il migliorare della comprensione dell’addestramento su più cicli: l’intervallo di confidenza all’80% del gruppo per l’esaurimento va dalla metà degli anni 2020 fino a circa il 2032. Revisioni più recenti hanno spostato l’estremo più vicino di quella finestra verso il 2028, man mano che si accumulavano prove del fatto che i modelli tollerano diversi cicli di addestramento sugli stessi dati senza un grave deterioramento.
La data esatta conta meno della tendenza: l’offerta di nuovi testi scritti da esseri umani non avrebbe mai tenuto il passo con la crescita della capacità di calcolo, e ogni laboratorio del settore lo sa. L’estremo più vicino di quell’intervallo non è più una previsione. È l’anno in corso.
| Stima di Epoch AI | Esaurimento del patrimonio di testi umani |
|---|---|
| Limite inferiore dell’intervallo di confidenza originale all’80% | metà degli anni 2020 — già raggiunta |
| Stima rivista dell’estremo più vicino | 2028 — tra due anni |
| Limite superiore dell’intervallo di confidenza originale all’80% | 2032 — tra sei anni |
Questa scarsità crea proprio l’incentivo sbagliato nel momento peggiore. Quando i dati umani sono limitati ed è costoso reperirli, selezionarli e ottenerne le licenze, i dati sintetici diventano un modo economicamente allettante per continuare ad aumentare la scala dei modelli: non perché qualcuno ritenga sicuro un ingenuo addestramento ricorsivo, ma perché l’alternativa è rallentare. La soluzione tecnica individuata da Gerstgrasser e colleghi — accumulare anziché sostituire e preservare la base di dati umani — richiede proprio quella gestione rigorosa dei dati che la stretta sull’offerta rende più difficile mantenere. Significa infatti che i laboratori non possono semplicemente sostituire i costosi token di origine umana con token sintetici a buon mercato: devono conservare entrambi e sapere quali sono gli uni e quali gli altri.
Il web stesso è l’esperimento fuori controllo
Mentre i laboratori discutono le strategie di accumulo all’interno delle proprie pipeline di addestramento, una versione molto meno controllata dello stesso esperimento è in corso su internet, la fonte da cui verranno raccolti i dati per il corpus di preaddestramento di ogni modello futuro. Diverse rilevazioni indipendenti — condotte con metodologie differenti e giunte a stime puntuali diverse, un fatto di per sé indicativo di quanto la misurazione sia ancora incerta — convergono sullo stesso quadro generale: la quota di testi appena pubblicati sul web generati dall’IA o realizzati con il suo ausilio è cresciuta rapidamente dalla fine del 2022 e rappresenta oggi una parte considerevole dei nuovi contenuti. Le stime relative alle pagine web recenti vanno da circa un terzo a un’ampia maggioranza, a seconda del metodo di rilevazione e della definizione di «generato dall’IA» adottata.
Qualunque sia la cifra esatta, la tendenza è inequivocabile: un modello addestrato oggi su una nuova raccolta di dati dal web usa un corpus che contiene già una quantità sconosciuta e crescente di output prodotti da modelli precedenti, senza etichette né filtri.
È lo scenario più vicino all’effettiva configurazione sperimentale dell’articolo pubblicato su Nature, ma esteso all’intero settore anziché circoscritto al ciclo di addestramento di un singolo laboratorio, e senza che un solo soggetto possa imporre una disciplina di accumulo su dati che nessuno controlla. Un laboratorio che cura attentamente la propria pipeline di addestramento per evitare il collasso dovuto alla sostituzione dei dati deve comunque fare i conti con un patrimonio di dati condiviso e non selezionato, al quale quella disciplina non si applica.
L’infrastruttura di provenienza è il vero collo di bottiglia
La risposta tecnicamente fondata a questo problema non è vietare i dati sintetici — significherebbe rinunciare ai benefici reali della distillazione e non impedirebbe ad altri di usarli — ma costruire un’infrastruttura che permetta a chiunque, al momento della raccolta dei dati, di distinguere i contenuti scritti da esseri umani da quelli generati dalle macchine. È l’obiettivo esplicito della Coalition for Content Provenance and Authenticity, un’iniziativa settoriale per la definizione di standard fondata da Adobe, Arm, Intel, Microsoft e Truepic, che associa a un contenuto un manifesto firmato crittograficamente nel quale ne sono registrate l’origine e la cronologia delle modifiche.
La versione 2,1 della specifica C2PA ha esteso questo approccio collegando le Content Credentials a filigrane digitali persistenti, anziché affidarsi esclusivamente ai metadati dei file. È un passaggio importante: basta salvare nuovamente o ricaricare un file per cancellare la provenienza registrata soltanto nei metadati, mentre una filigrana incorporata nei dati dei pixel o dei token è progettata per resistere a queste trasformazioni. La specifica pubblicata ha da allora raggiunto la versione 2,4. Da tempo lo standard non è più il collo di bottiglia.
Nel frattempo, la regolamentazione ha perseguito lo stesso obiettivo da un’altra direzione. L’articolo 50 dell’AI Act impone ai fornitori di sistemi che generano audio, immagini, video o testi sintetici di contrassegnare i loro output come generati artificialmente in una forma leggibile dalle macchine. Ha cessato di essere un obbligo futuro il 2 agosto 2026, quando sono diventate applicabili le restanti disposizioni dell’AI Act e la Commissione ha iniziato a far rispettare le norme sulla trasparenza; i fornitori i cui sistemi erano già sul mercato quel giorno hanno tempo fino al 2 dicembre 2026 per conformarsi all’articolo 50(2).
L’obbligo produce etichette. Non produce un corpus filtrabile. L’obbligo europeo di contrassegnare i contenuti riguarda i fornitori europei, non l’archivio pregresso del web aperto, né i modelli offerti dall’esterno dell’Unione, né i testi scritti dalle macchine già presenti in ogni raccolta di dati dal web effettuata dal 2023. La legge ora stabilisce che cosa dovrebbe fare un editore attento; nulla in essa dà a un crawler un interruttore per escludere ciò che un editore meno attento ha pubblicato tre anni fa.
Per ora, nulla di tutto questo risolve il problema. Gli standard di provenienza funzionano solo se l’adozione è quasi universale, e un manifesto o una filigrana ignorati da gran parte del web non proteggono un crawler che non riesce a distinguere su larga scala i contenuti contrassegnati da quelli che non lo sono. La distanza tra «esiste uno standard di provenienza» e «i corpus di addestramento sono filtrabili in modo affidabile in base alla provenienza» è oggi enorme. Colmarla è un problema di coordinamento in un ecosistema di editori, piattaforme e soggetti che raccolgono dati dal web con interessi contrapposti, nel quale nessun soggetto può imporre il rispetto delle regole.
Che cosa ne consegue davvero
Una lettura onesta delle prove mostra che il collasso dei modelli è un fenomeno dimostrato, di cui si comprende il meccanismo, che si verifica in una condizione specifica ed evitabile: un addestramento ricorsivo che sostituisce i dati reali invece di accumularli, senza controlli sulla provenienza che permettano di distinguere gli uni dagli altri. Non è un esito inevitabile insito nella matematica dello scaling, né una ragione per considerare tutti i dati sintetici pericolosi allo stesso modo: la distillazione dimostra che i dati sintetici generati secondo un gradiente di qualità e sotto supervisione umana restano uno dei modi più affidabili per trasferire capacità.
A rendere il rischio concreto, anziché puramente accademico, è la convergenza di tre tendenze distinte, ciascuna gestibile di per sé ma più difficile da controllare insieme alle altre: una riserva finita e sempre più esaurita di testi di addestramento prodotti da esseri umani; un web aperto in cui una quota considerevole dei nuovi contenuti è scritta dalle macchine e perlopiù non è etichettata come tale; e un’infrastruttura di provenienza che esiste nei documenti degli standard molto più di quanto non esista nei controlli effettivi al momento della raccolta dei dati.
Correggere anche una sola di queste tendenze ridurrebbe sensibilmente il rischio. Non correggerne nessuna, continuando nel frattempo ad ampliare le sessioni di addestramento attingendo a un patrimonio di dati condiviso sempre più scarso e contaminato, è lo scenario in cui il risultato di laboratorio dell’articolo pubblicato su Nature smette di essere un esperimento controllato e comincia a descrivere la traiettoria predefinita del settore.