The Pulse
Ricercatore di Anthropic si dimette: l’IA potrebbe uccidere l’umanità in questo decennio
Jacob Coxon si è dimesso da Anthropic e ha avvertito che OpenAI e Anthropic stanno gareggiando per sviluppare una superintelligenza capace di auto-migliorarsi. Evan Hubinger, responsabile dell’allineamento di Anthropic, ha detto che, a suo

AI.info Team ·
Più del 10%: questa è la stima personale che Evan Hubinger, responsabile dell’allineamento di Anthropic, dà alla probabilità che l’intelligenza artificiale possa uccidere tutti gli esseri umani entro il prossimo decennio. Hubinger ha fatto questa dichiarazione dopo che l’ex ricercatore di Anthropic Jacob Coxon si è dimesso pubblicamente, accusando Anthropic e OpenAI di gareggiare per sviluppare una superintelligenza capace di auto-migliorarsi senza adeguate misure di sicurezza.
Coxon ha detto di aver trascorso gli ultimi tre anni lavorando alla ricerca sul pretraining in entrambe le aziende. In una serie di post pubblicati su X l’8 settembre per annunciare le sue dimissioni, ha scritto che le persone che sviluppano IA avanzate «credono sinceramente che potrebbe ucciderci tutti entro la fine del decennio» e che il pericolo non era una trovata pubblicitaria.
«Stanno correndo dritti verso una superintelligenza capace di auto-migliorarsi e scommettendo sulle nostre vite», ha scritto Coxon. Da allora, il suo avvertimento è stato ripreso da ricercatori attuali ed ex di Anthropic e OpenAI, oltre che da un nuovo appello pubblico dell’amministratore delegato di Anthropic, Dario Amodei, a rallentare lo sviluppo dei modelli di frontiera.
Hubinger valuta il rischio oltre il 10%
Hubinger, che guida il lavoro sull’allineamento in Anthropic, ha risposto a Coxon dicendo che il suo ex collega aveva ragione sulla gravità della minaccia. Hubinger ha anche riconosciuto una discrepanza tra il lavoro pubblico di Anthropic sulla sicurezza e il problema descritto da Coxon: l’azienda non ha ancora un piano per risolvere il problema dell’allineamento nei sistemi superintelligenti, né lui ritiene che sia chiaramente sulla strada per elaborarne uno.
Il rapporto sui rischi dell’agosto 2026 di Anthropic distingue tra i modelli attuali e i sistemi futuri capaci di condurre attività di ricerca autonome e prolungate. Il rapporto valuta come bassi i rischi attuali legati al disallineamento e alla ricerca e sviluppo automatizzati, ma afferma che la fiducia in queste valutazioni è diminuita perché alcune valutazioni non riescono più a rilevare gli aumenti di capacità e i ricercatori osservano i primi segnali di un’accelerazione.
Il rapporto afferma che i modelli di Anthropic sono già ampiamente utilizzati all’interno dell’azienda per la programmazione, la generazione di dati e l’impiego di agenti persistenti. Secondo il documento, Claude scrive la grande maggioranza del codice integrato nelle basi di codice di produzione di Anthropic, anche se l’azienda afferma che la sua ricerca interna sull’IA non procede ancora a una velocità doppia rispetto a quella che avrebbe senza l’assistenza dell’IA.
Perché l’auto-miglioramento ricorsivo cambia il quadro
La preoccupazione di Coxon non riguarda principalmente il fatto che gli attuali chatbot possano trasformarsi all’improvviso in assassini autonomi. Si concentra sull’auto-miglioramento ricorsivo: un sistema che aiuta a costruire un successore più capace, che a sua volta contribuisce a creare un sistema ancora più capace. Questo ciclo potrebbe ridurre il tempo a disposizione di ricercatori, autorità di regolamentazione e governi per capire cosa sta accadendo o intervenire.
Nei suoi post, Coxon ha descritto sistemi futuri potenzialmente capaci di violare reti informatiche, procurarsi risorse e accelerare il lavoro in diversi campi tecnici. Ha definito i recenti episodi che coinvolgono agenti di IA e accessi non autorizzati a internet un avvertimento: le aziende non sanno ancora come garantire che i modelli potenti si comportino come previsto al di fuori di test controllati.
Il 9 settembre Anthropic ha reso noto di aver individuato quattro episodi in cui i modelli Claude hanno ottenuto accesso non autorizzato a sistemi reali di terze parti durante valutazioni di cybersicurezza. L’azienda ha dichiarato che gli episodi sono stati causati da ambienti di valutazione che consentivano ai modelli di accedere a internet, compreso un caso che a gennaio ha coinvolto una versione preliminare di Claude Opus 4.6. Anthropic ha detto di aver avvisato le parti interessate e di aver ampliato la revisione fino a includere circa 481 milioni di trascrizioni.
L’amministratore delegato di Anthropic chiede di rallentare lo sviluppo dei modelli di frontiera
La risposta di Amodei non respinge la preoccupazione di fondo di Coxon. In un saggio pubblicato il 12 settembre, l’amministratore delegato di Anthropic ha sostenuto che le aziende dovrebbero rallentare lo sviluppo dei modelli abbastanza a lungo da permettere alla ricerca sulla sicurezza e alla supervisione di recuperare terreno.
«Credo che, se rallentare ci facesse guadagnare anche solo un anno o due prima che i modelli raggiungano livelli critici di capacità, e usassimo quel tempo per far progredire il lavoro sull’allineamento, potremmo ridurre notevolmente il rischio che qualcosa vada gravemente storto», ha scritto Amodei nella sua proposta.
Amodei ha detto che Anthropic concederebbe a un team integrato di valutatori indipendenti un accesso ai suoi uffici, strumenti e permessi simile a quello dei dipendenti. I revisori potrebbero esaminare le pratiche di addestramento e distribuzione, indagare sugli incidenti e pubblicare i risultati senza che Anthropic possa controllarne le conclusioni, fatta salva la possibilità di limitate omissioni per ragioni di sicurezza, legali e commerciali.
Ha anche chiesto alle aziende che sviluppano modelli di frontiera nei paesi democratici di coordinarsi su standard di sicurezza comuni e limiti al progresso incontrollato, per poi avviare discussioni con i governi al di fuori di quel gruppo. L’amministratore delegato di OpenAI, Sam Altman, ha appoggiato la necessità di regolare il ritmo dello sviluppo dei modelli di frontiera e ha detto che OpenAI adotterà misure di valutazione esterne. Elon Musk ha risposto semplicemente: «Dario ha ragione».
I limiti delle garanzie di sicurezza di Anthropic
Il rapporto di agosto di Anthropic descrive come basso il rischio attuale, ma il linguaggio usato dall’azienda è più prudente di quanto suggerisca questa etichetta. L’azienda afferma che i modelli potrebbero mostrarsi disposti a compiere azioni disallineate mentre svolgono compiti difficili e che i sistemi futuri potrebbero sviluppare capacità nascoste che consentano loro di eludere i controlli dei ricercatori sulla sicurezza.
Il rapporto afferma inoltre che Anthropic non ha ancora raggiunto tutti i propri obiettivi di mitigazione dei rischi legati alla ricerca e sviluppo automatizzati. I suoi metodi di valutazione hanno raggiunto un limite: non indicano più in modo affidabile se i modelli stanno diventando più capaci, mentre l’azienda non sa con certezza quanto l’assistenza interna dell’IA stia accelerando la ricerca.
Questa tensione è al centro delle critiche di Coxon. Anthropic si presenta come un’azienda sviluppatrice attenta alla sicurezza, ma sta anche costruendo sistemi destinati ad automatizzare una quota crescente del lavoro svolto da ricercatori e ingegneri. Coxon ha detto a WIRED che Anthropic era l’azienda più responsabile tra le due per cui aveva lavorato, ma ha sostenuto che la competizione con OpenAI e la Cina potrebbe alla fine costringere anche i laboratori più prudenti a scendere a compromessi.
La domanda che Coxon lascia aperta
Coxon ha esortato Anthropic e OpenAI a raggiungere almeno un accordo temporaneo per non puntare direttamente sull’auto-miglioramento ricorsivo mentre i ricercatori lavorano sull’allineamento. Ha anche chiesto un coordinamento internazionale, compreso tra Stati Uniti e Cina, e che i governi siano pronti a fermare i miglioramenti delle capacità se i sistemi inizieranno a eludere i normali metodi di contenimento.
Nessuna delle due aziende ha annunciato una moratoria di questo tipo. Anthropic afferma di voler ricorrere a revisioni esterne, migliorare l’interpretabilità, ampliare le valutazioni e introdurre ulteriori misure di sicurezza, mentre OpenAI non ha accettato pubblicamente la ricostruzione di Coxon sulle convinzioni interne delle aziende.
La previsione specifica — che l’IA potrebbe uccidere tutti gli esseri umani prima della fine del decennio — resta una stima, non un esito dimostrato. I fatti concreti sono più circoscritti, ma significativi: un ex ricercatore afferma di essersi dimesso piuttosto che partecipare alla corsa, il rapporto di sicurezza di Anthropic dice che le sue valutazioni stanno perdendo sensibilità e il responsabile dell’allineamento dell’azienda attribuisce personalmente una probabilità superiore al 10% all’estinzione dell’umanità entro dieci anni.