Vai al contenuto
AI.info

Ricerca

Decoy Direction Optimization: una difesa a posteriori contro l’abliterazione degli LLM

Le protezioni di sicurezza dei modelli linguistici a pesi aperti possono essere facilmente aggirate con Refusal Feature Ablation (RFA), una tecnica che individua una direzione lineare del rifiuto nel

Decoy Direction Optimization: una difesa a posteriori contro l’abliterazione degli LLM
arXiv
2609.16204
Pubblicato
2026-09-14
Autori
Aashiq Muhamed, Mona T. Diab, Virginia Smith

Abstract degli autori

Le protezioni di sicurezza dei modelli linguistici a pesi aperti possono essere facilmente aggirate con Refusal Feature Ablation (RFA), una tecnica che individua una direzione lineare del rifiuto nel flusso residuo e la elimina mediante proiezione. Spesso ottiene un elevato tasso di successo degli attacchi (ASR) senza compromettere le capacità del modello. Difendersi da questi attacchi richiede di norma un costoso fine-tuning di sicurezza per ogni nuovo checkpoint. Presentiamo Decoy Direction Optimization (DDO), una difesa rapida che modifica i pesi a posteriori senza richiedere il fine-tuning del modello di base. Il nostro approccio si fonda su una semplice osservazione sul funzionamento del modello: gli attacchi per ablazione usano stimatori contrastivi per trovare la direzione del rifiuto. Anziché tentare di nascondere il vero meccanismo del rifiuto, DDO inietta nei neuroni MLP della rete un segnale esca non lineare di grande ampiezza. Quando un attaccante cerca di individuare la direzione del rifiuto, l’esca altera il suo stimatore e lo induce a eliminare una caratteristica ortogonale innocua, mentre il meccanismo di sicurezza effettivo resta intatto. Dimostriamo un limite spettrale che formalizza questo effetto e valutiamo DDO su sei famiglie di modelli, ottenendo un ASR <10% con RFA standard. Su Llama-3-8B-Instruct, DDO resta paragonabile alle difese addestrate sotto attacchi adattivi in più fasi (65% contro 58% di ASR nel caso peggiore) e riduce l’ASR dell’attacco Heretic a livello dei pesi dall’88,7% al 18%, il tutto con un costo di ottimizzazione per configurazione da 30 a 450 volte inferiore a quello delle difese di riferimento addestrate.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv