Vai al contenuto
AI.info

The Pulse

Darktrace usa 78 turni inventati per dirottare le sessioni degli agenti di IA

Darktrace riferisce che modificare le cronologie delle conversazioni salvate localmente ha indotto agenti di IA a svolgere attività di sicurezza offensiva in test controllati.

Darktrace usa 78 turni inventati per dirottare le sessioni degli agenti di IA

AI.info Team ·

78 turni inventati hanno cambiato la risposta dell’agente

Darktrace afferma che sono bastati 78 turni di conversazione inventati per indurre un agente di IA a eseguire una richiesta di sfruttamento della rete che aveva appena rifiutato. I ricercatori dell’azienda hanno modificato cronologie di chat archiviate in locale, fornendo agli agenti un falso resoconto di precedenti attività autorizzate di red team. In un ambiente sandbox, un agente ha quindi svolto attività di ricognizione e altri compiti di sicurezza offensiva.

La scoperta, pubblicata il 24 settembre, riguarda un presupposto di fiducia nei software per agenti: i messaggi dell’assistente salvati localmente potrebbero essere accettati come autentici senza verificare che siano stati effettivamente generati dal modello. Darktrace afferma di aver riprodotto l’avvelenamento delle cronologie con Claude Code di Anthropic, Codex di OpenAI, Kiro-CLI di AWS e l’ecosistema open source Pi. Il lavoro è stato scritto da Eric Rozon, identificato da Darktrace come ricercatore senior in sicurezza informatica.

Le cronologie delle conversazioni locali sono diventate la superficie d’attacco

I framework per agenti assemblano il contesto di un modello a partire dalla cronologia delle conversazioni, dalle istruzioni e dagli strumenti collegati. Alcuni archiviano tale cronologia sul computer dell’utente, per consentire di riprendere o modificare le sessioni. Darktrace afferma che i prodotti esaminati non verificavano le risposte archiviate dell’assistente confrontandole con un registro del fornitore del modello, lasciando quei messaggi esposti a modifiche.

I ricercatori hanno modificato le cronologie per far apparire l’agente già impegnato in test di sicurezza autorizzati. Secondo il loro resoconto, tutti i modelli esaminati hanno accettato la cronologia inventata come contesto della conversazione, ma la loro propensione a svolgere attività offensive è variata.

«Nei nostri test, tutti i modelli esaminati hanno accettato la cronologia inventata che è stata loro mostrata, ma la resistenza alle attività informatiche offensive variava da un modello all’altro, e in alcuni casi le barriere di sicurezza hanno impedito di procedere.»

— Eric Rozon, ricercatore senior in sicurezza informatica presso Darktrace

Alcuni controlli di sicurezza hanno bloccato determinate azioni, tra cui Claude Opus 5 in un test e i modelli Codex quando Darktrace ha provato a indurli ad attaccare il suo laboratorio.

Modelli diversi, esiti diversi

Darktrace riferisce che Claude Opus 4.6 e Claude Sonnet 4.5, utilizzati tramite Kiro-CLI, sono stati guidati in un laboratorio sandbox in cui i ricercatori hanno ottenuto la compromissione completa di Active Directory. Anche Claude Sonnet 5, tramite Claude Code, ha portato a una compromissione completa nello stesso ambiente; un tentativo con Claude Opus 5 è stato bloccato dalle barriere di sicurezza.

In un test separato con Codex, afferma Darktrace, GPT 5.6 Sol è stato convinto a esfiltrare informazioni sensibili via email. L’azienda dichiara che i suoi modelli sono stati eseguiti senza accesso attendibile, utilizzando un abbonamento standard ad AWS Kiro oppure, per Claude Code e Codex, modelli ospitati su Amazon Bedrock. Questi risultati descrivono esperimenti controllati, non attacchi che, secondo Darktrace, si sarebbero verificati contro le reti dei clienti.

Un pacchetto malevolo potrebbe installare la cronologia

Darktrace illustra un possibile percorso che dalla vulnerabilità porta a un attacco sul posto di lavoro: uno sviluppatore installa un pacchetto malevolo, come un server MCP, e il suo codice modifica il database locale delle conversazioni dell’agente all’avvio del framework. Il pacchetto potrebbe quindi avviare un ciclo automatizzato che induce l’agente ad agire contro la rete a cui può accedere. Darktrace presenta questa sequenza come uno scenario, non come un incidente osservato.

Darktrace afferma di aver comunicato le sue scoperte ad Anthropic, AWS e OpenAI il 18 agosto 2026. La nota sulla divulgazione descrive una pubblicazione dopo un periodo di 30 giorni, ma la pagina è datata 24 settembre 2026, 37 giorni dopo la data di divulgazione indicata. Darktrace afferma di non aver comunicato la scoperta a Pi, che descrive come un framework open source anziché come un fornitore di modelli. L’azienda propone che i fornitori firmino crittograficamente le risposte dei modelli e verifichino tali firme quando i messaggi tornano al servizio; secondo Darktrace, i responsabili della difesa non possono applicare da soli questa correzione lato fornitore.

Per le organizzazioni che utilizzano agenti con accesso alla shell o credenziali interne, la distinzione pratica è tra una trascrizione che sembra autentica e una di cui è stata verificata la provenienza. La misura di protezione proposta da Darktrace è la verifica lato server delle risposte firmate, affiancata dal monitoraggio dei comportamenti dell’agente che si discostano dal suo schema abituale.

Fonte

Esplora

Altri articoli