Ricerca
Rimuovere NEEDLE dal pagliaio: eliminare le backdoor negli LLM mediante l’ortogonalizzazione dei pesi
Gli attacchi backdoor possono essere impiantati nei modelli linguistici di grandi dimensioni (LLM) durante l’addestramento, provocando comportamenti indesiderati quando nell’input compare un trigger.

- arXiv
- 2610.00348
- Pubblicato
- 2026-09-29
- Autori
- Minoo Kim, Vasileios Lampos, George Drayson
Abstract degli autori
Gli attacchi backdoor possono essere impiantati nei modelli linguistici di grandi dimensioni (LLM) durante l’addestramento, provocando comportamenti indesiderati quando nell’input compare un trigger. Le difese esistenti contro le backdoor negli LLM cercano di eliminarle, ma alterano inavvertitamente la distribuzione degli output del modello per i prompt benigni, con possibili effetti negativi sulle prestazioni e sulla sicurezza. Proponiamo NEEDLE, un metodo per eliminare in modo mirato le backdoor senza ulteriore addestramento. Una volta identificato un trigger, il metodo stima una direzione della backdoor e un sottospazio del rifiuto attraverso vettori di attivazione, quindi applica un’ortogonalizzazione sequenziale dei pesi per sopprimere la backdoor evitando modifiche alle rappresentazioni legate al rifiuto. NEEDLE non richiede né un modello di riferimento non compromesso né i dati di addestramento originali avvelenati. La valutazione riguarda diverse famiglie di modelli e tipologie di attacco. Tra le difese valutate, NEEDLE ottiene il più basso tasso medio di successo degli attacchi (ASR), incluso uno 0% nei complessi attacchi di code injection, e al tempo stesso presenta la minima divergenza KL e modifiche minime alle capacità e alla sicurezza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv