The Pulse
Anthropic descrive l’uso improprio di Claude in campagne informatiche, biologiche e di distillazione
Anthropic afferma che alcuni attori ostili hanno usato Claude in attacchi informatici, ricerche biologiche a duplice uso e operazioni su larga scala per copiare le capacità dei suoi modelli. Il rapporto di settembre 2026 individua anche pre

AI.info Team ·
L’ultimo rapporto di Anthropic sulle minacce si apre con un problema che somiglia meno a un uso improprio dei chatbot che a un cambiamento nel modo in cui opera la criminalità informatica: gli aggressori umani scelgono gli obiettivi, mentre i sistemi di IA si occupano di ricognizione, sviluppo degli strumenti, sfruttamento delle vulnerabilità, mantenimento dell’accesso e furto di dati. In una campagna attribuita a un attore legato allo Stato russo, procedure assistite da Claude hanno ricostruito ripetutamente malware dopo che i prodotti di sicurezza lo avevano rilevato, per poi impiegare gli strumenti modificati contro nuove vittime.
Il rapporto, pubblicato il 10 settembre, esamina attività che Anthropic afferma di aver contrastato tra dicembre 2025 e agosto 2026. Le sue sette categorie comprendono operazioni informatiche, sorveglianza, campagne di influenza, frodi, uso improprio in ambito biologico, sviluppo di armi convenzionali e distillazione illecita, cioè l’estrazione occulta delle capacità di un modello per addestrarne un altro.
Secondo Anthropic, i casi hanno coinvolto i suoi modelli Haiku, Sonnet e Opus. Nessuno dei casi di uso improprio ha riguardato i modelli Fable o Mythos dell’azienda, fatta eccezione per una campagna di distillazione. Il rapporto presenta gli episodi come esempi selezionati, non come un censimento completo degli usi impropri, e distingue ripetutamente le prove di attività sospette dalla dimostrazione di intenti malevoli.
Claude passa da assistente a operatore informatico
Il caso informatico più approfondito da Anthropic riguarda GTG-20006, un attore che, secondo l’azienda, corrisponde a quanto riportato pubblicamente sul gruppo russo Midnight Blizzard. L’operazione ha preso di mira organizzazioni di intelligence militare in Ucraina e in Europa, organismi diplomatici e della difesa, centri studi e persone legate alla politica estera degli Stati Uniti.
Il gruppo ha usato Claude tramite procedure personalizzate che automatizzavano gran parte della catena d’attacco. Secondo Anthropic, gli strumenti coprivano l’acquisizione di infrastrutture, il phishing, il mantenimento dell’accesso tramite sistemi di comando e controllo, il furto di credenziali e l’esfiltrazione dei dati. L’attore ha usato l’IA anche per verificare se il malware fosse stato rilevato: quando un prodotto di sicurezza segnalava uno strumento, agenti automatizzati lo modificavano e ricostruivano finché non eludeva il sistema di rilevamento osservato.
Secondo Anthropic, più di 20 organizzazioni figuravano nella pianificazione operativa e nelle attività in corso dell’attore. Tra gli obiettivi c’erano personale governativo e militare ucraino, produttori e fornitori di droni, hotel che offrivano un accesso indiretto ai viaggiatori, un’autorità tecnologica governativa nordafricana e organizzazioni diplomatiche e governative che usavano Microsoft 365.
La campagna non si basava su una vulnerabilità sconosciuta né su una nuova forma di malware. La conclusione di Anthropic è più circoscritta e più rilevante: tecniche note come phishing, credenziali rubate, servizi esposti e dirottamento del DNS sono diventate meno costose da applicare a molti obiettivi perché l’IA svolgeva un lavoro che un tempo richiedeva diversi specialisti.
«Di fatto automatizzano parti del lavoro all’interno dell’apparato di intelligence», ha detto ad Axios Jacob Klein, responsabile dell’intelligence sulle minacce di Anthropic. Secondo Klein, l’IA rendeva la sorveglianza sostenuta dagli Stati meno costosa e più efficiente, senza cambiare radicalmente chi i governi prendono di mira.
Cinque casi biologici mettono in luce il problema del duplice uso
Le conclusioni di Anthropic in ambito biologico sono più caute delle informazioni divulgate dal rapporto sulle attività informatiche. L’azienda non sostiene che Claude abbia consentito di realizzare un’arma biologica e non identifica le istituzioni, i paesi o gli agenti specifici coinvolti. Descrive invece cinque casi in cui gli utenti hanno cercato un’assistenza che avrebbe potuto favorire ricerche biologiche pericolose, pur somigliando anche a legittime attività scientifiche.
Un caso riguardava una domanda di finanziamento per una ricerca gain-of-function sulla chikungunya, un virus trasmesso dalle zanzare. Secondo Anthropic, il lavoro proposto si concentrava sulla trasmissibilità e sull’elusione della risposta immunitaria e mirava a individuare mutazioni, introdurle in cloni infettivi e selezionare una maggiore virulenza negli animali. L’azienda ha bloccato la richiesta e in seguito ha scoperto che il lavoro era associato a un istituto di ricerca militare.
Gli utenti accedevano al modello attraverso una piattaforma rivolta ai ricercatori delle scienze della vita in regioni in cui Anthropic non offre ufficialmente i propri servizi. Secondo il rapporto, la piattaforma instradava il traffico attraverso infrastrutture statunitensi, usava un servizio che non conservava i dati e manteneva la possibilità di ricorrere a un altro modello quando Claude rifiutava una richiesta. Anthropic ha sospeso gli account collegati e collaborato con partner per interrompere la rete di inoltro, ma afferma che l’operatore ha ripristinato l’accesso nel giro di pochi giorni usando nuove identità e abbonamenti per consumatori.
Un altro ricercatore ha usato Claude per settimane mentre pianificava esperimenti su come i virus dell’influenza aviaria si adattano ai mammiferi. Anthropic afferma che i suoi sistemi di classificazione hanno limitato il lavoro ai modelli meno potenti, circoscrivendo l’assistenza all’analisi amministrativa, alla progettazione degli studi e ad attività correlate. L’azienda stima che, in quel caso, il contributo di Claude fosse nettamente inferiore a quello di una ricerca biologica condotta da esperti.
Altri casi erano più difficili da classificare. Un utente ha fatto redigere a Opus, in circa un’ora, una domanda di finanziamento per una ricerca sugli orthopoxvirus, comprendente l’ipotesi, il disegno sperimentale, i dosaggi, i piani statistici e le misure da adottare in caso di imprevisti. Altri due ricercatori hanno sviluppato sistemi computazionali relativi a peptidi del veleno e tossine, presentando il lavoro come finalizzato ad analgesici, antidepressivi e altre applicazioni terapeutiche, ma producendo anche risultati che avrebbero potuto contribuire alla realizzazione di composti nocivi.
Anthropic afferma che un ricercatore ha volutamente lasciato vaghe le identità di una tossina batterica e di una proteina di un virus responsabile di febbre emorragica nei rapporti sull’avanzamento dei lavori. L’azienda ha sospeso gli account per violazione delle regole sulle regioni in cui offre i propri servizi, ma non ha affermato che i ricercatori intendessero causare danni. Un esame di 30 giorni delle attività associate a istituzioni statali ha individuato circa 35 filoni di ricerca distinti, perlopiù normali attività scientifiche civili, alcuni dei quali presentavano un notevole potenziale a duplice uso.
La preoccupazione dichiarata dall’azienda non è che ogni richiesta sospetta in ambito biologico corrisponda a un programma di sviluppo di armi. Il problema è che le stesse informazioni tecniche possono servire, da un lato, a sviluppare vaccini e trattamenti o a studiare le epidemie e, dall’altro, a progettare agenti biologici più dannosi. Secondo Anthropic, i filtri possono bloccare le richieste esplicite, ma non possono dedurre in modo affidabile le intenzioni da un lavoro tecnicamente sofisticato che, esaminato uno scambio alla volta, appare benefico.
Alibaba, DeepSeek e Zhipu puntano alle capacità di ragionamento di Claude
Anthropic usa l’espressione «distillazione illecita» per descrivere campagne su scala industriale che estraggono le capacità di un modello attraverso un gran numero di richieste non autorizzate e le riproducono in un altro sistema. La distillazione legittima è un metodo di addestramento standard: un modello più piccolo, detto «studente», apprende dalle risposte generate da un modello più grande, detto «insegnante». Secondo Anthropic, in questi casi la differenza sta nella scala occulta delle operazioni, nelle frodi e nella mancanza di autorizzazione.
L’azienda identifica sette laboratori con sede in Cina come responsabili di ulteriori campagne di distillazione da febbraio. Afferma che le operazioni hanno usato false identità, carte di pagamento rubate, chiavi API compromesse, servizi proxy e servizi di instradamento verso modelli di terze parti. Questi servizi talvolta conservavano le conversazioni degli utenti e le vendevano ad altre organizzazioni, creando un problema distinto per la privacy oltre al tentativo di copiare le capacità di Claude.
Anthropic definisce un’operazione di Alibaba la più grande campagna di distillazione che abbia misurato. Secondo l’azienda, la campagna prendeva di mira le trascrizioni dei ragionamenti di Opus 4.6 e 4.7, ha raggiunto un picco di quasi 3 milioni di scambi al giorno e ha usato più di 3.500 account fraudolenti. Il materiale estratto riguardava attività svolte da agenti, ingegneria del software, sviluppo di kernel e lavori che richiedono un’azione prolungata nel tempo ed è stato usato per addestrare o migliorare i modelli Qwen di Alibaba, secondo Anthropic.
L’attività di DeepSeek comportava un diverso tipo di esposizione. Secondo Anthropic, DeepSeek ha instradato attraverso Claude richieste selezionate dei propri utenti, comprese conversazioni inviate mediante strumenti di programmazione come Claude Code e altri ambienti di terze parti. In 14 giorni di luglio, l’azienda ha osservato più di 12,1 milioni di scambi attribuiti a DeepSeek. Alcuni contenevano informazioni aziendali interne, dati governativi e credenziali attive, anche se Anthropic non ha affermato che in ogni caso fossero esposti dati di persone statunitensi.
Secondo Anthropic, Zhipu, nota fuori dalla Cina come Z.ai, ha usato 273 account fraudolenti in un’operazione durata dieci giorni contro Claude Opus 4.8. L’azienda ha contato 770.609 scambi passati attraverso un sistema di estrazione della catena di ragionamento e ha attribuito a Zhipu più di 3 milioni di ulteriori scambi nello stesso periodo. Zhipu ha inoltre usato Claude per valutare gli output, ripulire le trascrizioni, generare attività e testare i modelli nella propria pipeline di addestramento.
Anthropic attribuisce separatamente a Xiaomi più di 400.000 scambi distribuiti su più di 1.500 account. SenseTime avrebbe acquistato da fornitori di dati trascrizioni di Claude raccolte da altri, mentre Anthropic afferma che MiniMax ha creato un servizio proxy tramite una società di comodo che offriva accesso ai modelli di Anthropic e OpenAI, ma non a modelli cinesi. Secondo l’azienda, questi risultati suggeriscono che il servizio potrebbe essere stato creato per raccogliere scambi con modelli di frontiera statunitensi da usare nell’addestramento dei modelli.
Perché la distillazione cambia i termini della sicurezza
Secondo Anthropic, il pericolo non si limita alla copia delle prestazioni in un benchmark di programmazione o ragionamento. La capacità di ragionamento generale migliora le prestazioni in molte attività, perciò un modello addestrato su output rubati potrebbe acquisire capacità che vanno oltre gli argomenti trattati nelle conversazioni raccolte.
Anthropic afferma che, nei propri test, un modello ottenuto distillando un sistema di frontiera può acquisire capacità pericolose in biologia e nelle operazioni informatiche anche quando gli scambi usati per l’addestramento contengono poco materiale direttamente relativo a questi ambiti. Le misure di sicurezza applicate a Claude non si trasferiscono automaticamente al modello non autorizzato che apprende dai suoi output.
L’azienda descrive anche ripetuti tentativi di estrarre i ragionamenti interni manipolando i prompt. Un laboratorio ha testato più di 12.000 richieste diverse per scoprire quali tecniche potessero rivelare le tracce del ragionamento. Altri tentativi chiedevano a Claude di tradurre in un’altra lingua un ragionamento precedente o di trattare una falsa istruzione come un prompt di sistema.
Anthropic afferma di usare ora metadati, segnali di attività irregolare e sistemi di classificazione specializzati per individuare le campagne di estrazione. Ha inoltre modificato il modo in cui Claude presenta i ragionamenti interni, introdotto misure di sicurezza che limitano la possibilità per i nuovi account di modificare prompt e strumenti nelle conversazioni con più scambi e iniziato ad adottare criteri di attribuzione più ampi, a livello di account, anziché sospendere gli account sospetti uno alla volta.
La soluzione preferita da Anthropic è un accesso basato sulla verifica e sull’affidabilità
Il rapporto indica un modello di gestione dell’accesso che combina filtri sui contenuti con verifiche dell’identità e delle istituzioni. Anthropic sostiene che le capacità biologiche ad alto rischio non possano essere offerte in sicurezza attraverso un accesso anonimo e generalista, perché i filtri non riescono a distinguere ogni ricerca legittima da un’attività dannosa. Programmi basati sulla verifica e sull’affidabilità, istituzioni verificate e un certo grado di conservazione dei dati consentirebbero ai fornitori di indagare sugli usi impropri, preservando al tempo stesso l’accesso per gli scienziati autorizzati.
Questo approccio comporta un compromesso che il rapporto non risolve. Un maggiore monitoraggio può aiutare a individuare ricerche condotte di nascosto e accessi ai modelli ottenuti con mezzi illeciti, ma significa anche che informazioni aziendali, personali e governative sensibili possono passare attraverso intermediari senza che gli utenti capiscano dove finiscano. Tra gli esempi citati da Anthropic figurano previsioni finanziarie aziendali, credenziali degli sviluppatori e materiale relativo ad attività governative inoltrato da servizi di modelli di terze parti.
Il messaggio più concreto del rapporto è che l’uso improprio non si limita più a singoli jailbreak. Gli operatori informatici affidano ai sistemi di IA lunghe sequenze di attività, i ricercatori usano modelli di frontiera in programmi biologici dalle finalità ambigue e laboratori concorrenti costruiscono processi industriali per copiare il comportamento dei modelli. Anthropic afferma di aver sospeso gli account individuati, condiviso informazioni di intelligence con le autorità e altre aziende di IA e rafforzato le proprie misure di sicurezza. Il rapporto chiarisce anche che bloccare un fornitore non pone necessariamente fine a un’operazione: gli attori possono passare a un altro modello, a un’installazione locale o a una nuova rete proxy.