The Pulse
I ricercatori della CMU aggiungono esche per bloccare l’abliterazione degli LLM
Un preprint della Carnegie Mellon University propone Decoy Direction Optimization, una difesa a posteriori contro gli attacchi che rimuovono il comportamento di rifiuto dai modelli linguistici a pesi aperti. Il metodo riduce sotto il 10% il

AI.info Team ·
Una modifica di due minuti prende di mira le misurazioni dell’attaccante
Una difesa che richiede circa due minuti su una singola GPU A100 riduce sotto il 10% gli attacchi standard di ablazione del rifiuto su sei famiglie di modelli linguistici, secondo un nuovo preprint della Carnegie Mellon University. Il metodo, chiamato Decoy Direction Optimization, modifica un piccolo numero di neuroni MLP già esistenti invece di riaddestrare il modello di base.
Aashiq Muhamed, Mona T. Diab e Virginia Smith descrivono la tecnica in un articolo inviato ad arXiv il 14 settembre 2026. Il loro obiettivo è l’«abliterazione», una categoria di attacchi white-box che stima la direzione interna associata al comportamento di rifiuto e la rimuove da un modello a pesi aperti.
L’articolo presenta DDO come un passaggio di irrobustimento a posteriori per i checkpoint rilasciati. I pesi di base restano congelati, le modifiche vengono integrate nel modello e il sistema distribuito non riceve ulteriori componenti architetturali o di runtime. Gli autori hanno rilasciato il codice di implementazione insieme al preprint.
DDO nasconde il rifiuto dietro un falso segnale
Refusal Feature Ablation funziona confrontando le attivazioni del modello su prompt dannosi e sicuri. L’attaccante calcola un vettore della differenza tra le medie, lo considera la direzione del rifiuto e proietta tale direzione fuori dal flusso residuo. Questo approccio può rimuovere il rifiuto lasciando intatta gran parte delle capacità generali del modello.
DDO prende di mira questa misurazione, invece di cercare di cancellare o distribuire ampiamente il meccanismo di rifiuto. Il metodo riutilizza neuroni a basso impatto negli strati feed-forward del modello. Questi neuroni rilevano un’attivazione legata al rifiuto nei prompt dannosi, quindi producono un segnale forte in direzioni progettate per restare ortogonali alla vera direzione del rifiuto.
Quel segnale funge da esca nella stima contrastiva dell’attaccante. Se l’esca domina la differenza tra le attivazioni su prompt dannosi e sicuri, una procedura standard di abliterazione ha maggiori probabilità di rimuovere la caratteristica artificiale invece del meccanismo che produce il rifiuto. Gli autori formalizzano l’idea definendo limiti alla sovrapposizione tra la direzione stimata dall’attaccante e il sottospazio causale del rifiuto del modello.
Con Llama-3 il successo degli attacchi scende dall’85% all’1,8%
Su Llama-3-8B-Instruct, l’articolo riporta che Refusal Feature Ablation standard raggiunge un tasso di successo dell’85% senza la difesa. DDO riduce il dato all’1,8%, mantenendo un punteggio MMLU dichiarato di 66,8 e un punteggio XSTest di 91,6.
Gli autori valutano il metodo su Llama-3, Yi-1.5, Qwen3, Gemma-2, Mistral e GLM-4. Su queste sei famiglie di modelli, DDO registra un successo degli attacchi inferiore al 10% nella valutazione RFA standard dell’articolo. L’articolo riporta anche i risultati su altri sette modelli, per ciascuno dei quali il dato resta sotto il 10% dopo un’ottimizzazione specifica.
Il vantaggio computazionale di DDO deriva dal suo obiettivo di ottimizzazione circoscritto. Un’esecuzione usa 256 prompt di prova — 128 dannosi e 128 sicuri — e modifica i neuroni selezionati invece di effettuare un ciclo completo di fine-tuning per la sicurezza. Gli autori stimano che l’esecuzione richieda due minuti su una GPU A100, rispetto a circa 1–15 ore-GPU A100 per configurazione per le difese addestrate usate nel confronto.
Ne risulta una riduzione dichiarata di 30–450 volte del costo di ottimizzazione per configurazione. Il confronto riguarda la fase di configurazione, non tutti i costi associati alla valutazione, alla ricerca degli iperparametri o ai test degli attacchi.
Gli attaccanti adattivi mettono in luce il divario residuo
I risultati migliori riguardano un attacco fisso, che stima una sola volta la direzione del rifiuto. DDO funziona meno bene quando l’attaccante ricalcola ripetutamente la direzione dopo ogni ablazione.
In un test adattivo in otto fasi su Llama-3-8B-Instruct, l’articolo riporta per DDO un tasso di successo degli attacchi nel caso peggiore del 65%. La migliore baseline addestrata del confronto, RepBend, raggiunge il 58%. DDO mantiene output coerenti durante il test, con un punteggio MT-Bench di 5,82 all’ottava fase, ma il risultato mostra che le esche non rendono impossibile rimuovere il rifiuto.
L’articolo testa anche Heretic, uno strumento automatizzato di modifica dei pesi che cerca aggiornamenti in grado di rimuovere il rifiuto. DDO riduce il tasso di successo degli attacchi di Heretic dall’88,7% sul modello non protetto al 18% su Llama-3-8B-Instruct. RepBend funziona meglio contro questo attacco a livello dei pesi, raggiungendo l’1,3%, risultato che gli autori attribuiscono al più profondo intreccio dei parametri creato dall’addestramento basato sul gradiente.
DDO è una difesa che aumenta i costi, non una garanzia permanente. L’articolo afferma che la ricalibrazione adattiva prolungata resta un problema e segnala un aumento dell’eccesso di rifiuto in alcuni modelli.
I jailbreak basati sui prompt danno risultati contrastanti
I ricercatori testano anche attacchi che agiscono tramite prompt, anziché modificare direttamente i pesi o le attivazioni. DDO, combinato con un passaggio di debiasing ortogonale, registra un tasso di successo degli attacchi dello 0,4% contro GCG e dell’1,2% contro il set HumanJailbreaks dell’articolo.
I risultati contro gli attacchi semantici sono più deboli. Con DDO e il debiasing, PAIR raggiunge un tasso di successo degli attacchi del 36,3%. Gli autori sostengono che PAIR aggiri il rifiuto attraverso il significato e la struttura della conversazione, anziché sopprimere la stessa geometria delle attivazioni presa di mira dall’abliterazione. Affermano che per questa categoria di attacchi servono ancora classificatori a livello di input o altre difese complementari.
La distinzione è importante per chi pubblica modelli a pesi aperti. Un checkpoint può resistere a uno script noto per rimuovere una direzione e restare comunque esposto a ricalibrazioni ripetute, a ricerche a livello dei pesi o a un attacco che sfrutta la strategia del dialogo. DDO restringe una delle vie d’accesso al comportamento di rifiuto del modello, ma i risultati presentati nell’articolo ne lasciano aperte diverse altre.
Una difesa pratica con una rivendicazione circoscritta
Il contributo del preprint non consiste tanto nel sostenere che la sicurezza possa essere resa permanente con una modifica, quanto nel proporre un modo meno costoso per irrobustire checkpoint già addestrati. Il metodo usa i circuiti di rifiuto già presenti nel modello come innesco, collocando la risposta-esca in direzioni separate: così chi pubblica il modello può applicare la procedura dopo l’addestramento e prima del rilascio.
I limiti del metodo sono espliciti. Gli attacchi adattivi possono recuperare una quota sostanziale di risposte dannose, in almeno un confronto l’ottimizzazione a livello dei pesi supera ancora DDO e alcuni modelli mostrano un maggiore eccesso di rifiuto dopo la modifica. Questi risultati fanno di DDO uno strato difensivo per i modelli rilasciati a pesi aperti, non un sostituto dell’addestramento, della valutazione o dei filtri esterni.
Il codice e gli esperimenti dell’articolo sono disponibili nel repository pubblico degli autori, mentre il preprint completo è disponibile su arXiv.