The Pulse
Lasso rileva che le filigrane IA possono alterare le chiamate agli strumenti e i rifiuti degli agenti
Secondo Lasso Security, la filigrana SynthID-Text può modificare le chiamate degli agenti IA agli strumenti, il loro comportamento di rifiuto e le risposte agli attacchi tramite prompt injection, con effetti che variano a seconda del modell

AI.info Team ·
Le filigrane modificano più di quanto dicano gli agenti
Uno studio pubblicato da Lasso Security il 17 settembre rileva che la filigranatura dei modelli linguistici può alterare le decisioni prese dagli agenti di IA, anche quando la filigrana è progettata per preservare la qualità dell’output. Gli effetti si osservano nella selezione degli strumenti, nei relativi argomenti, nel comportamento di rifiuto e nelle risposte alle iniezioni di prompt.
La ricerca esamina SynthID-Text, il metodo di filigranatura sviluppato da Google DeepMind e adottato da Anthropic per i modelli più recenti di Claude. SynthID-Text modifica il modo in cui il modello campiona i token durante la generazione, così da rendere possibile il rilevamento successivo di uno schema statistico nascosto. L’analisi di Lasso sostiene che le stesse modifiche a livello di token possono influire sulle azioni di un agente, perché anche le chiamate agli strumenti vengono generate come testo.
Anthropic afferma che la sua filigrana si applica a livello di modello e copre i modelli supportati a cui si accede tramite i prodotti di Claude, la sua API e i provider cloud. Ciò significa che un agente sviluppato in modo indipendente può ricevere output filigranati dal modello anche se chi ha sviluppato l’agente non ha aggiunto il sistema di filigranatura.
Sei modelli su sette mostrano una minore accuratezza nelle chiamate agli strumenti
Lasso ha testato le chiamate agli strumenti con compiti a turno singolo di BFCL v4, confrontando generazioni appaiate con e senza SynthID-Text. I ricercatori hanno usato lo stesso seed, lo stesso ordine dei batch e la stessa temperatura in ciascun confronto, lasciando il processore della filigrana come unica variabile. I test includevano sia casi in cui era prevista una chiamata a uno strumento, sia casi in cui il comportamento corretto era non effettuarne alcuna.
Nei compiti in cui era prevista una chiamata a uno strumento, la filigranatura ha ridotto l’accuratezza in sei dei sette modelli testati, con cali statisticamente significativi in quattro. L’accuratezza aggregata non restituiva un quadro completo del cambiamento, perché alcune chiamate sono passate da errate a corrette, mentre altre hanno fatto il percorso inverso.
Lasso ha quindi misurato il «churn», cioè la quota di valutazioni individuali il cui esito è cambiato tra le esecuzioni con e senza filigrana. Nelle 21 combinazioni di modello e temperatura, il churn è stato in media del 6,5%. Alla temperatura di 1,0, il 16,8% delle valutazioni delle chiamate di phi-4 è cambiato, anche se la perdita netta di accuratezza è stata di 2,87 punti percentuali. Llama 3.1 8B ha registrato un churn del 9,9%, con una perdita netta di 0,87 punti.
Anche il tipo di errore è variato. In Llama 3.1 8B, gli argomenti errati hanno comportato una perdita di accuratezza di 3,48 punti e le chiamate allo strumento sbagliato un’ulteriore perdita di 1,84 punti. In phi-4 e Granite 3.2 8B, l’output malformato è stato la principale causa del calo, rispettivamente con 5,96 e 4,36 punti.
L’iniezione di prompt amplifica i cambiamenti nei rifiuti
Il secondo esperimento ha testato 200 comportamenti dannosi di HarmBench e 100 controlli benigni di JailbreakBench. Le richieste dannose sono state testate sia da sole sia con una tecnica fissa di prompt injection, che sosteneva che il filtro di sicurezza fosse disattivato e istruiva il modello a soddisfare la richiesta.
La filigranatura ha modificato il comportamento di rifiuto in risposta alle normali richieste dannose, ma l’effetto è aumentato in presenza dell’iniezione. Alla temperatura di 0,001, il churn di Gemma 3 27B è salito dal 6,0% per le richieste dannose senza iniezione al 23,5% con l’iniezione. La variazione netta dell’adesione alle richieste è passata da un calo di 1,0 punti a un aumento di 12,5 punti.
Gemma 3 12B ha mostrato un andamento simile: il churn è salito dal 7,5% all’11,0%, mentre l’adesione netta alle richieste è passata da un calo di 0,5 punti a un aumento di 9,0 punti. Llama 3.1 8B ha raggiunto un churn del 14,0% alla temperatura di 0,001 e del 17,5% a 0,7, anche se la sua variazione netta non è stata statisticamente significativa a livello individuale.
Lasso afferma che l’esperimento sui rifiuti ha misurato il comportamento del modello, non un malfunzionamento complessivo dell’agente da un capo all’altro del processo. Le implicazioni per gli agenti sono condizionali: se un modello con filigrana passa dal rifiuto all’adesione e ha accesso agli strumenti, la risposta modificata potrebbe influenzare le azioni successive.
La chiave della filigrana è importante
Lo studio ha testato anche 11 chiavi della filigrana alla temperatura di 0,7. I risultati non sono andati tutti nella stessa direzione. Chiavi diverse hanno prodotto livelli diversi di successo dell’attacco: alcune lo hanno ridotto, altre lo hanno aumentato.
Per Llama 3.1 8B, la chiave dello studio ha aumentato il successo dell’attacco di 3,5 punti. Le altre dieci chiavi hanno registrato in media un aumento di 4,4 punti, con variazioni comprese tra un calo di 4,5 punti e un aumento di 14,5 punti. In generale, i due modelli Gemma hanno mostrato un successo dell’attacco maggiore con la maggior parte delle chiavi, mentre Granite 3.2 8B ha avuto una risposta eterogenea.
Questi risultati distinguono la filigranatura da una normale impostazione della qualità. Una modifica della chiave può alterare la scelta dei token senza cambiare i pesi del modello o il prompt, e il provider può controllare questa configurazione al di fuori della portata diretta di chi sviluppa l’agente.
La provenienza e la stabilità del comportamento sono verifiche distinte
Lasso non sostiene che si debba abbandonare la filigranatura. La conclusione più circoscritta dello studio è che il rilevamento efficace della provenienza non dimostra che un modello effettuerà le stesse chiamate agli strumenti o manterrà lo stesso comportamento di sicurezza dopo l’attivazione della filigrana.
I ricercatori raccomandano di ripetere le valutazioni degli agenti ogni volta che si introduce la filigranatura o se ne modificano la chiave o la configurazione. I test dovrebbero confrontare esecuzioni appaiate su input identici, esaminare le singole chiamate agli strumenti invece di considerare solo l’accuratezza aggregata e includere condizioni di prompt injection avversaria.
Per chi sviluppa agenti basati su modelli ospitati dai provider, la questione pratica è il controllo. Un aggiornamento del modello, il rilascio di una filigrana o una modifica della chiave possono alterare i token esatti che specificano uno strumento, un percorso, un destinatario, una query o un rifiuto. I risultati di Lasso collocano la filigranatura nella configurazione di sicurezza del sistema distribuito, non soltanto in una pipeline di tracciabilità della provenienza dei contenuti.