Ricerca
Stessi byte, autorità diversa: le rappresentazioni dei token riservati nella prompt injection tramite template di chat
La prompt injection contro gli agenti basati su LLM diventa molto più efficace quando l’istruzione inserita è racchiusa nel template di chat del modello stesso. Un marcatore di template falsificato, c

- arXiv
- 2609.35932
- Pubblicato
- 2026-09-28
- Autori
- Yan Zhan, Yunze Song, Mengkai Hou, Wanting Zhang, Shaobo Liu, Zhijun Gao
Abstract degli autori
La prompt injection contro gli agenti basati su LLM diventa molto più efficace quando l’istruzione inserita è racchiusa nel template di chat del modello stesso. Un marcatore di template falsificato, come <|im_start|>, può arrivare al modello come un unico token di controllo riservato oppure come una sequenza di normali sottotoken. Entrambi vengono decodificati esattamente nello stesso testo e, poiché la tokenizzazione avviene sul server, è il sistema che si difende, non l’attaccante, a decidere quale dei due il modello riceva. Sfruttiamo questa differenza per misurare quanta parte dell’autorità dell’istruzione inserita derivi dalla rappresentazione appresa del token riservato. Codificare i marcatori falsificati come sottotoken, mantenendo invariato il testo e introducendo un controllo per i token aggiuntivi che ciò comporta, riduce il tasso di successo dell’attacco sul benchmark InjecAgent di 39–66 punti percentuali in tre delle quattro famiglie di modelli a pesi aperti; il divario si riscontra anche nelle attività degli agenti su più turni in AgentDojo. Su Qwen3-8B il divario è di 8 punti, perché, anche senza ID riservati, il modello riconosce il turno falsificato ragionando sul suo testo; sopprimere il blocco di ragionamento porta il divario a 50 punti. L’autorità risiede nel singolo vettore appreso nella posizione del marcatore: la media dei vettori dei suoi sottotoken non lo riproduce, il vettore del token ordinario più vicino ripristina l’attacco su Llama-3.1 e un attaccante adattivo che cerca marcatori non riservati trova vicini nello spazio degli embedding in tre delle quattro famiglie. In ogni coppia di modelli base e sottoposti a instruction tuning che abbiamo esaminato, l’instruction tuning rafforza la preferenza del modello per i marcatori riservati. La misura di mitigazione standard, un’opzione del tokenizer che codifica i token speciali come normali sottotoken, si applica soltanto ai token che una configurazione dichiara speciali. Perciò, in 33 delle 67 configurazioni distinte del tokenizer, che riguardano 255 dei 400 modelli di chat più scaricati su Hugging Face, lascia intatti i token del protocollo degli strumenti attraverso i quali gli agenti leggono gli output non attendibili degli strumenti, e il divario persiste su quel canale.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv