Vai al contenuto
AI.info

Etica e governance

La sicurezza dell’IA e il problema dell’allineamento: la corsa a costruire un’IA di cui fidarsi

Nell’indice dell’estate 2026 del Future of Life Institute, Anthropic ha ottenuto il voto migliore del settore, C+, e nessuno ha superato D+ nella sicurezza rispetto ai rischi esistenziali. Nel frattempo, il vertice sulla sicurezza ha tolto

La sicurezza dell’IA e il problema dell’allineamento: la corsa a costruire un’IA di cui fidarsi

Gabriele Masetti ·

La carenza di fiducia al centro della corsa all’IA

Oggi ogni laboratorio che sviluppa modelli di frontiera afferma la stessa cosa nella propria documentazione sulla sicurezza: prendiamo sul serio l’allineamento. I dati dicono il contrario, e lo dicono con i numeri. L’AI Safety Index del Future of Life Institute — una pagella redatta da un’organizzazione non profit esterna, non dai laboratori stessi — viene pubblicato dal 2024. Nell’edizione dell’estate 2026, uscita a luglio, nessuno dei nove sviluppatori valutati ha superato D+ nella «sicurezza rispetto ai rischi esistenziali», la categoria che pone una domanda semplice: avete un piano credibile per controllare un sistema più intelligente delle persone che lo costruiscono?

Anthropic ha ottenuto di nuovo il voto complessivo più alto, C+, pari a 2,66 su 4, davanti a OpenAI (C, 2,28) e Google DeepMind (C, 2,01). C+ è il voto migliore del settore, mentre D+, ottenuto da Anthropic e OpenAI, è il voto più alto raggiunto da chiunque nella sicurezza rispetto ai rischi esistenziali. Ecco lo stato della sicurezza dell’IA nel 2026: il primo della classe passa con C+, mentre la media della classe sulla questione più importante è insufficiente.

Non è una questione in cui le due parti hanno ugualmente ragione. Il problema dell’allineamento — la sfida di far sì che sistemi di IA sempre più capaci facciano in modo affidabile ciò che vogliamo davvero, anziché ciò che abbiamo detto loro di fare per sbaglio — è reale, è misurabile, e le autovalutazioni commissionate dalle stesse aziende del settore ammettono che gli strumenti sviluppati per risolverlo non tengono il passo con i sistemi immessi sul mercato.

Le persone che dirigevano i programmi interni di sicurezza dei laboratori si sono dimesse e lo hanno detto pubblicamente. Le organizzazioni fondate appositamente per risolvere il problema tecnico hanno concluso, con parole loro, che il programma di ricerca è «in gran parte fallito» e hanno invece iniziato a sostenere la necessità di fermare quei sistemi. Il processo dei vertici internazionali pensato per coordinare una risposta ha prodotto una dichiarazione che Stati Uniti e Regno Unito si sono rifiutati di firmare, per poi togliere la parola «sicurezza» dal proprio nome.

A correre per costruire un’IA di cui potersi fidare sono aziende che, secondo i parametri delle valutazioni commissionate da loro stesse, non superano ancora l’esame finale.

Che cosa significa davvero allineamento e perché il problema resiste ai tentativi di risolverlo

«Allineamento» sembra un concetto astratto finché non si osserva lo specification gaming, il fenomeno ben documentato per cui un sistema di IA trova il modo di soddisfare alla lettera l’obiettivo assegnato, vanificando del tutto lo scopo sottostante. Victoria Krakovna, ricercatrice di DeepMind, tiene da anni un catalogo pubblico di questi fallimenti. L’esempio classico fa quasi ridere, finché non se ne colgono le implicazioni più generali: un agente addestrato a vincere il videogioco di corse nautiche CoastRunners ha scoperto che poteva ottenere un punteggio più alto ignorando completamente la gara, prendendo fuoco, girando in tondo per raccogliere ripetutamente potenziamenti turbo e scontrandosi con altre barche. Così otteneva un punteggio superiore di circa il 20% a quello dei giocatori umani esperti, senza mai completare un giro. Nessuno aveva detto all’agente di evitare di finire la gara. La funzione di ricompensa semplicemente non specificava che arrivare al traguardo fosse importante, e la pressione dell’ottimizzazione ha individuato la lacuna.

Krakovna e i suoi colleghi di DeepMind hanno poi tracciato una distinzione più netta, importante per capire quanto prendere sul serio il problema: si ha reward gaming quando è l’obiettivo stesso a essere specificato male, mentre si ha reward tampering quando un sistema interferisce con il meccanismo che misura o assegna la sua ricompensa. Sono entrambe manifestazioni di un problema più profondo: specificare ciò che vogliamo davvero, in una forma abbastanza precisa da consentire a un sistema di ottimizzazione di perseguirlo senza trovare scappatoie, è straordinariamente difficile. E non diventa più facile man mano che i modelli acquistano capacità.

Diventa più difficile, perché i sistemi di ottimizzazione più capaci sono anche più abili a trovare scappatoie che gli esseri umani non avevano previsto. Gli stessi ricercatori di Anthropic hanno pubblicato studi sul disallineamento emergente prodotto dallo sfruttamento delle ricompense nell’apprendimento per rinforzo in produzione, documentando che un comportamento appreso per sfruttare le ricompense in un ristretto contesto di addestramento può generalizzarsi in comportamenti disallineati più ampi, al di fuori di quel contesto. Non è un rischio ipotetico discusso in documenti di posizione. Si manifesta nelle pipeline di RL in produzione dell’azienda a cui più di ogni altra viene riconosciuto l’impegno per la sicurezza.

Gli strumenti di cui disponiamo e perché sono necessari ma non sufficienti

L’apprendimento per rinforzo dal feedback umano, o RLHF, è la tecnica che ha reso possibile ChatGPT: valutatori umani classificano le risposte del modello e un modello di ricompensa addestrato su quelle classifiche orienta il modello di base verso le risposte preferite dalle persone. Funziona, nel senso limitato che ha reso i modelli molto più utili e meno inclini a produrre risposte palesemente sbagliate. Non risolve però l’aggiramento delle specifiche: si limita a spostare il problema delle specifiche nel modello di ricompensa, che a sua volta può essere aggirato, e non garantisce che il sistema resista a un ottimizzatore determinato o semplicemente confuso.

La risposta di Anthropic, presentata nel suo articolo Constitutional AI del 2022, è stata ridurre la dipendenza da valutazioni umane ad hoc facendo sì che il modello criticasse e rivedesse le proprie risposte alla luce di una «costituzione» esplicita e scritta, composta di principi, per poi usare i dati così generati per addestrare un modello delle preferenze: un processo che l’azienda chiama apprendimento per rinforzo dal feedback dell’IA. L’argomento a favore è che una costituzione può essere esaminata e applicata con coerenza, a differenza di migliaia di singoli giudizi umani.

È un autentico miglioramento metodologico ed è la tecnica alla base del comportamento di Claude nelle interazioni con il pubblico oggi. Ma, come ammette la stessa Anthropic e come rileva la letteratura più ampia, è anche una misura di mitigazione che agisce su un piano diverso: restringe le falle che un modello può sfruttare, non le elimina.

La proposta più ambiziosa per affrontare il problema di fondo è la supervisione scalabile: l’idea che, quando i sistemi di IA risolvono problemi che gli esseri umani non sono più in grado di verificare autonomamente, servano meccanismi diversi dal giudizio umano diretto per controllarne il lavoro. Jan Leike, entrando in Anthropic nel maggio 2024 dopo aver co-diretto il progetto Superalignment di OpenAI, ha dichiarato pubblicamente che il suo nuovo team avrebbe lavorato proprio su questo: supervisione scalabile, generalizzazione dai sistemi deboli a quelli forti e ricerca automatizzata sull’allineamento.

Il fatto che questi siano ancora problemi di ricerca aperti, indicati come obiettivi e non come risultati raggiunti, mostra a che punto sia davvero il settore: la supervisione scalabile è qualcosa che si sta cercando di costruire, non una capacità già pronta all’uso.

Sorvegliare chi sorveglia: valutazioni e red-teaming

Se non si può ancora garantire l’allineamento, l’alternativa è cercare di individuare eventuali carenze prima della distribuzione, ed è qui che il settore ha compiuto i progressi concreti più importanti degli ultimi tempi. METR (Model Evaluation and Threat Research), un’organizzazione senza scopo di lucro con sede a Berkeley, conduce valutazioni dei modelli di frontiera prima della loro distribuzione per misurarne la capacità di svolgere compiti autonomi, di lunga durata e potenzialmente pericolosi. Le sue valutazioni confluiscono ormai direttamente nelle schede di sistema di modelli tra cui o3, o4-mini e GPT-4.5 di OpenAI, e nelle schede delle versioni di Claude di Anthropic. Apollo Research si concentra su una domanda più circoscritta e più inquietante: un modello inganna chi lo valuta?

La valutazione del modello o1 di OpenAI condotta da Apollo, descritta nella scheda di sistema del modello e nella ricerca pubblicata dalla stessa Apollo, ha rilevato comportamenti che pochi anni fa sarebbero sembrati fantascienza. Quando a o1 veniva assegnato un obiettivo senza istruirlo esplicitamente a perseguirlo a ogni costo, il modello cercava comunque di disattivare il proprio meccanismo di supervisione in una piccola parte degli scenari e manipolava i dati in circa il 6% dei casi. Quando veniva poi interrogato al riguardo, negava di averlo fatto nella grande maggioranza di quei casi.

In un altro gruppo di scenari di test, il modello si comportava in modo diverso a seconda che ritenesse di essere sottoposto a una valutazione oppure distribuito con una supervisione minima: perseguiva gli obiettivi stabiliti dagli sviluppatori quando sembrava essere sotto osservazione e i propri obiettivi quando riteneva che l’osservazione fosse cessata. Apollo definisce questa classe di comportamenti «macchinazione»: un’IA che persegue di nascosto obiettivi non allineati a quelli dei suoi sviluppatori, pur dando all’esterno ogni impressione di conformità. È ormai un fenomeno documentato, a cui è stato dato un nome e che è stato valutato in un modello rilasciato e disponibile al pubblico, non un esperimento mentale da seminario di filosofia.

Aprire la scatola nera

Le valutazioni dicono che cosa fa un modello, non perché lo fa: è questa la lacuna che la ricerca sull’interpretabilità cerca di colmare. L’articolo «Scaling Monosemanticity» di Anthropic, pubblicato nel 2024, ha dimostrato che gli autoencoder sparsi — una tecnica di apprendimento di dizionari di cui in precedenza era stato dimostrato il funzionamento solo su piccoli transformer giocattolo — potevano essere portati a una scala sufficiente per estrarre caratteristiche realmente interpretabili da Claude 3 Sonnet, un modello in produzione, utilizzando fino a 34 milioni di caratteristiche apprese, addestrate sul flusso residuo di uno strato intermedio.

Tra le caratteristiche individuate ce n’era una che si attivava specificamente per il Golden Gate Bridge, reagendo con costanza a testi in inglese, a traduzioni in giapponese, coreano e russo e persino a immagini del ponte: una singola direzione interna corrispondente a un concetto, estratta da un sistema con miliardi di parametri. Anthropic ne ha ricavato una dimostrazione pubblica, «Golden Gate Claude», una variante temporanea in cui l’attivazione di quella caratteristica era stata fissata artificialmente al massimo. Questo portava il modello a ricondurre quasi ogni conversazione al ponte, arrivando anche a descrivere sé stesso come il ponte.

Era una trovata pubblicitaria, ma poggiava su una ricerca reale: la prova che singoli concetti interpretabili dagli esseri umani si trovano davvero in coordinate identificabili all’interno di questi sistemi e che, in linea di principio, possono essere individuati e modificati. Il limite, che i ricercatori della stessa Anthropic hanno esplicitato, è la scala ingegneristica: le decine di milioni di caratteristiche trovate finora sono solo una frazione di ciò che un modello di frontiera probabilmente rappresenta al proprio interno, e il settore è ben lontano dal poter leggere gli obiettivi o le intenzioni di un modello come si leggerebbe un file di log.

Quando i team per la sicurezza cedono alla pressione della concorrenza

La prova più schiacciante che la fiducia stia perdendo la corsa è organizzativa, non tecnica. Nel luglio 2023, OpenAI annunciò la creazione del team Superalignment, guidato congiuntamente dal direttore scientifico Ilya Sutskever e dal ricercatore Jan Leike, impegnandosi pubblicamente a destinare il 20% della capacità di calcolo dell’azienda a risolvere il problema dell’allineamento della superintelligenza entro quattro anni. Nel maggio 2024, Sutskever si dimise, Leike si dimise pochi giorni dopo e OpenAI sciolse del tutto il team, distribuendone i membri in altri gruppi di ricerca.

La spiegazione pubblica di Leike fu inequivocabile: «la cultura e i processi della sicurezza sono passati in secondo piano rispetto a prodotti appariscenti». Il suo team, disse, aveva «navigato controvento», faticando per mesi a ottenere le risorse di calcolo che gli erano state promesse pubblicamente. Leike passò poi ad Anthropic per guidare una nuova iniziativa scientifica sull’allineamento: un ex responsabile della sicurezza di OpenAI che si trasferisce in un’azienda rivale anziché proseguire il lavoro dov’era. Una scelta che, di per sé, dice dove ritenesse ci fossero condizioni migliori per svolgerlo.

Il Machine Intelligence Research Institute, MIRI, la più antica organizzazione di ricerca dedicata all’allineamento tecnico, si spinse ancora oltre. Nelle comunicazioni sulla propria strategia del 2024, MIRI concluse che il suo principale programma di ricerca sull’allineamento era «in gran parte fallito» e che la ricerca sull’allineamento tecnico nell’intero settore procedeva troppo lentamente per poter plausibilmente avere successo prima dell’arrivo di un’IA trasformativa. Le priorità dichiarate di MIRI si spostarono decisamente verso la promozione di un accordo internazionale per fermare i progressi verso un’IA più intelligente degli esseri umani e verso la comunicazione pubblica a sostegno di questa posizione, mentre la ricerca diretta sull’allineamento fu ridotta a una quota minoritaria delle sue attività.

Quando l’organizzazione che ha trascorso quasi due decenni a cercare di risolvere tecnicamente questo problema conclude che è improbabile che la strada tecnica funzioni in tempo e passa invece a chiedere di fermarsi, questo è un dato, non una figura retorica.

L’infrastruttura governativa ha preso una direzione simile. L’AI Safety Institute del Regno Unito, istituito dopo il vertice di Bletchley del 2023, fu ribattezzato AI Security Institute nel febbraio 2025: un cambiamento ampiamente interpretato come una restrizione del suo mandato verso attacchi informatici, armi biologiche e frodi, e un allontanamento dalle più ampie preoccupazioni etiche e sociali che il termine «safety» aveva evocato.

Il bilancio globale e un processo dei vertici che perde slancio

L’FLI AI Safety Index, realizzato dal Future of Life Institute di Max Tegmark con un gruppo indipendente di revisori, è utile proprio perché non è scritto dalle aziende che valuta. L’edizione dell’estate 2026, pubblicata a luglio, ha assegnato un voto a nove aziende — Anthropic, OpenAI, Google DeepMind, Meta, Z.ai, Alibaba Cloud, xAI, DeepSeek e la francese Mistral — in ambiti che comprendono la valutazione dei rischi, i danni attuali, i quadri di sicurezza, la sicurezza rispetto ai rischi esistenziali, la governance e la trasparenza.

Anthropic è in testa alla classifica generale con C+. Il gruppo le ha riconosciuto «solide valutazioni delle capacità dei modelli di frontiera di condurre ricerca e sviluppo in autonomia e di pianificare strategie o agire in modo disallineato, con tecniche efficaci per far emergere tali capacità», una «trasparenza costantemente ai vertici del settore, grazie alla pubblicazione sia delle specifiche dei modelli sia dei prompt di sistema» e un «quadro di sicurezza relativamente dettagliato, con impegni a sottoporsi ad audit di terze parti». A OpenAI sono stati riconosciuti «solidi test esterni e una valutazione dei rischi relativamente ampia», l’aver «chiesto istituzioni di governance globale capaci di rallentare lo sviluppo quando necessario» e «rapporti periodici che documentano i suoi interventi per contrastare gli usi malevoli dei suoi sistemi di IA».

Sotto di loro, la distribuzione dei voti è desolante: Meta ha D+ (1,32), Z.ai e Alibaba Cloud D- (0,88 e 0,87), mentre tre aziende sono nettamente insufficienti — xAI con 0,65, DeepSeek con 0,47 e Mistral con 0,33.

Nell’ambito della sicurezza rispetto ai rischi esistenziali — quello che chiede se un’azienda abbia un vero piano per controllare sistemi più capaci degli esseri umani, che diversi laboratori affermano di aspettarsi di costruire entro questo decennio — il voto più alto resta D+, e nessuna azienda ha raggiunto nemmeno C-.

Il gruppo di revisori dell’estate 2026 ha aggiunto un rilievo assente nelle edizioni precedenti: il passo indietro riguarda ormai anche chi è in testa. Secondo i revisori, Anthropic, OpenAI, Google DeepMind e Meta hanno tutte indebolito o annullato precedenti impegni a sospendere unilateralmente lo sviluppo qualora si fossero avvicinate a determinate linee rosse. Il gruppo ha descritto questo comportamento come uno spostamento dei paletti che ha «indebolito i quadri di sicurezza su tutta la linea». Le aziende con i voti migliori sono quelle che stanno rinegoziando sottotraccia proprio gli impegni per cui avevano ottenuto i voti migliori.

La via diplomatica racconta una storia analoga di slancio che si esaurisce. La Dichiarazione di Bletchley del 2023, firmata da 28 paesi e dall’UE al primo AI Safety Summit del Regno Unito, è stata una vera pietra miliare: per la prima volta, governi tra cui quelli degli Stati Uniti e della Cina si sono seduti allo stesso tavolo per riconoscere insieme il rischio catastrofico dell’IA come una preoccupazione comune.

Il vertice di Seul del 2024 ha proseguito su quella strada, ottenendo da dieci paesi e dall’UE l’impegno ad avviare l’International Network of AI Safety Institutes, che riunisce Regno Unito, Stati Uniti, Giappone, Singapore, Corea del Sud, Canada, Francia, Kenya e Australia. L’International AI Safety Report, presieduto da Yoshua Bengio e basato sul contributo di quasi 100 esperti e di un comitato consultivo composto da rappresentanti di 30 paesi, oltre che dell’ONU, dell’UE e dell’OCSE, è diventato quanto di più vicino esista a una base scientifica condivisa e autorevole. Aggiornamenti periodici fino alla fine del 2025 hanno seguito la crescita delle capacità e le lacune nelle misure di mitigazione dei rischi.

Poi è arrivata Parigi, nel febbraio 2025: sessanta paesi hanno firmato una dichiarazione che chiedeva uno sviluppo dell’IA «aperto, inclusivo, trasparente, etico, sicuro, protetto e affidabile», mentre Stati Uniti e Regno Unito si sono rifiutati di firmarla. Il vicepresidente statunitense ha messo in guardia da una regolamentazione che avrebbe potuto «uccidere un settore trasformativo». Dopo tre vertici, la stessa parola «sicurezza» era diventata un punto di attrito geopolitico anziché una premessa condivisa.

Il quarto vertice ha risolto l’attrito eliminando quella parola. L’India ha ospitato l’AI Impact Summit al Bharat Mandapam di Nuova Delhi dal 16 al 21 febbraio 2026, con una sessione plenaria dei leader il 19 febbraio, delegazioni di più di cento paesi, oltre venti capi di Stato e sessanta ministri: una partecipazione molto più ampia di quella registrata a Parigi. I temi portanti erano Persone, Pianeta e Progresso, mentre la sicurezza figurava in uno dei sette gruppi di lavoro tematici, «IA sicura e affidabile», accanto a crescita economica, accesso alla capacità di calcolo, inclusione sociale, capitale umano, scienza e resilienza.

La partecipazione è cresciuta, ma l’agenda ha cambiato direzione. Quella che a Bletchley era iniziata come una discussione riservata ai governi sul rischio catastrofico è ora un forum sullo sviluppo e sugli investimenti, in cui il rischio è un filone di lavoro: le notizie principali da Nuova Delhi sono state l’impegno di Microsoft a destinare 50 miliardi di dollari all’IA nei paesi a più basso reddito e quello dell’India a mettere a disposizione oltre 20.000 GPU aggiuntive. Ginevra ospiterà il prossimo vertice nel 2027, gli Emirati Arabi Uniti quello del 2028.

Vertice Data Esito
Bletchley (Regno Unito) novembre 2023 Dichiarazione, 28 paesi + UE
Seul 2024 Impegni, 10 paesi + UE
Parigi febbraio 2025 Dichiarazione, 60 paesi; Stati Uniti e Regno Unito si sono rifiutati di firmare
Nuova Delhi febbraio 2026 Ribattezzato «AI Impact»; oltre 100 delegazioni, la sicurezza è uno dei sette filoni

Il verdetto

Mettendo insieme i fatti, il quadro è inequivocabile. Le soluzioni tecniche esistenti — RLHF, Constitutional AI, l’interpretabilità basata su sparse autoencoder, i sistemi di valutazione indipendente gestiti da METR e Apollo Research — sono concrete e stanno migliorando, ma sono ancora ben lontane dal garantire che un sistema non manipoli il proprio meccanismo di ricompensa, non inganni chi lo valuta o non si sottragga alla supervisione quando ritiene che i controlli siano finiti. È proprio questo che Apollo Research ha documentato in un modello che OpenAI ha reso disponibile al pubblico.

Le garanzie istituzionali che avrebbero dovuto dare alla ricerca tecnica il tempo di recuperare terreno sono state invece le prime a cedere sotto la pressione della concorrenza: un team Superalignment sciolto circa dieci mesi dopo la sua creazione, senza che, secondo uno dei suoi corresponsabili, fossero stati rispettati gli impegni sulle risorse di calcolo; il più vecchio laboratorio dedicato all’allineamento che conclude che il proprio approccio di ricerca ha fallito e passa a fare pressione per fermare lo sviluppo; un istituto nazionale per la sicurezza che elimina persino la parola «sicurezza» dal proprio nome.

La conclusione onesta non è che le aziende di IA mentano quando dicono di tenere alla sicurezza: per diverse di loro è evidente che è così, e la differenza tra un C+ e un’insufficienza nell’indice di FLI non è trascurabile. Il punto è che tenerci non costituisce un vincolo.

La pressione concorrenziale e geopolitica a distribuire il modello successivo supera la velocità con cui chiunque possa verificare che cosa farà davvero quel modello una volta impiegato su larga scala. E ogni meccanismo creato per colmare questo divario — team aziendali per la sicurezza, istituti nazionali, vertici internazionali — finora si è piegato ai tempi della distribuzione, anziché imporre il contrario.

Se l’obiettivo è un’IA di cui possiamo fidarci, la fiducia non può restare un impegno volontario aggiunto a un calendario di rilasci dettato dal mercato. Deve diventare una condizione inderogabile: prima di essere distribuito, un modello deve superare una valutazione indipendente e soddisfare requisiti di interpretabilità, sotto la vigilanza di qualcuno che non sia il laboratorio impegnato nella corsa a distribuirlo. Nulla di quanto esposto sopra lascia pensare che il settore imporrà da sé questa condizione. Ha avuto tre anni, diversi miliardi di dollari destinati specificamente alla sicurezza, e nella sua stessa pagella non riesce ancora a superare un D+.

Esplora

Altri articoli