Vai al contenuto
AI.info

Ricerca

Non giudicare un LLM solo dalle sue attivazioni: individuare le feature di sicurezza soppresse attraverso il potenziale di attivazione controfattuale

L’interpretabilità meccanicistica è diventata il principale strumento per comprendere i comportamenti di sicurezza degli LLM. Gli strumenti esistenti, però, si concentrano soprattutto sui neuroni o su

Non giudicare un LLM solo dalle sue attivazioni: individuare le feature di sicurezza soppresse attraverso il potenziale di attivazione controfattuale
arXiv
2610.05541
Pubblicato
2026-10-04
Autori
Swadesh Swain, Sanghamitra Dutta

Abstract degli autori

L’interpretabilità meccanicistica è diventata il principale strumento per comprendere i comportamenti di sicurezza degli LLM. Gli strumenti esistenti, però, si concentrano soprattutto sui neuroni o sulle feature che si attivano in un modello. Il ruolo del vasto insieme di componenti che restano inattivi sfugge a questi metodi. Questo lavoro dimostra che tale insieme contiene feature cruciali per la sicurezza, che hanno un ruolo causale nel rifiuto dei prompt dannosi. Sopprimerle può trasformare i rifiuti in risposte che assecondano i prompt, senza che gli strumenti di interpretabilità più diffusi se ne accorgano. Introduciamo il Counterfactual Activation Potential (CAP), una metrica che quantifica la tendenza latente all’attivazione di una feature soppressa come prodotto del suo allineamento con l’encoder (quanto l’input ne favorisce l’attivazione), dell’intensità della soppressione (quanto le feature attive la inibiscono) e della sua importanza per la sicurezza (quanto il rifiuto dipende da essa). Per individuare su larga scala le feature di sicurezza soppresse, proponiamo CAP-guided Safety Feature Discovery (CSFD), un algoritmo di selezione in due fasi che identifica feature di sicurezza candidate tra centinaia di migliaia di feature dei transcoder, senza ricorrere a un’ablazione esaustiva. Quando una feature candidata viene sottoposta ad ablazione, una quota significativa delle prove produce risposte che assecondano prompt dannosi. Nei jailbreak naturali, la soppressione esercitata sulle feature con i valori CAP più alti aumenta di 2-4 volte e la loro attivazione diminuisce di conseguenza fino all’80%. Potenziare le feature che ne sopprimono una riduce l’attivazione di quest’ultima e aumenta le risposte che assecondano prompt dannosi legati alla feature soppressa; non si osserva lo stesso effetto per feature scelte a caso. I nostri esperimenti comprendono cinque modelli Gemma, Qwen e Llama con diverse quantità di parametri. I risultati indicano che i jailbreak potrebbero agire in parte sopprimendo feature cruciali per la sicurezza, anziché soltanto attivando feature dannose, e che lo studio delle feature soppresse è un complemento necessario all’interpretabilità dei comportamenti di sicurezza incentrata sulle attivazioni.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv