Ricerca
Scegli il tuo veleno: come selezionare insiemi di esempi avvelenati per attacchi backdoor più efficaci contro gli LLM
Gli attacchi di avvelenamento con backdoor aggiungono esempi avvelenati a dati di fine-tuning altrimenti non contaminati, associando un trigger a un comportamento bersaglio che il modello impara a pro

- arXiv
- 2609.15029
- Pubblicato
- 2026-09-14
- Autori
- Aashiq Muhamed, Mona T. Diab, Virginia Smith, Andrew Ilyas, Matthew Jagielski
Abstract degli autori
Gli attacchi di avvelenamento con backdoor aggiungono esempi avvelenati a dati di fine-tuning altrimenti non contaminati, associando un trigger a un comportamento bersaglio che il modello impara a produrre quando compare il trigger. Le valutazioni esistenti, in genere, fissano il numero di esempi avvelenati e li estraggono casualmente da un insieme di candidati. Mostriamo che questo approccio può sottostimare gravemente la vulnerabilità nel caso peggiore: in tre scenari di backdoor con LLaMA-3-8B, mantenendo invariati il modello, i dati non contaminati e il numero di esempi avvelenati, il tasso di successo dell’attacco varia dal 3% all’80% soltanto in base all’insieme di esempi avvelenati scelto. Formalizziamo la selezione di questi esempi come un problema di ottimizzazione di insiemi soggetto a un budget di interrogazioni all’oracolo e presentiamo SAILS (Set-level Audit-Informed Iterative Learned Selection), che apprende a valutare gli insiemi a partire da poche centinaia di esecuzioni di fine-tuning e valutazione, classifica milioni di insiemi candidati e ne verifica soltanto un ristretto gruppo. SAILS migliora in media di 30 punti percentuali il tasso di successo degli attacchi su dati tenuti da parte rispetto ai più efficaci metodi di riferimento basati sull’influenza, trasferisce i risultati dal fine-tuning su piccola scala a quello su scala completa e si estende alle backdoor per la generazione di codice, per gli agenti e in scenari con accesso alle sole API.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv