The Pulse
I ricercatori di Apple rendono più selettiva la regolazione delle attivazioni degli LLM
I ricercatori di Apple presentano Dynamically Scaled Activation Steering, un metodo che regola l’intensità dell’intervento token per token, invece di applicare un’unica impostazione globale. I test su Qwen 2.5 e Gemma 2 mostrano una minore

AI.info Team ·
I ricercatori di Apple affrontano una debolezza centrale dell’activation steering: i metodi che sopprimono comportamenti indesiderati del modello possono alterare anche risposte che non richiedevano alcun intervento. La soluzione proposta, Dynamically Scaled Activation Steering, applica la trasformazione di steering in modo selettivo, regolandone l’intensità per i singoli token e livelli del modello, anziché trattare allo stesso modo ogni input.
Il lavoro, pubblicato sul sito di ricerca di Apple dedicato al machine learning nel settembre 2026 e descritto in un articolo datato 24 agosto, presenta DSAS come un framework che può affiancarsi a diversi metodi di steering esistenti. Gli autori riportano una minore tossicità e una migliore conservazione delle capacità linguistiche generali nei modelli Qwen 2.5 e Gemma 2. L’articolo è disponibile su Apple Machine Learning Research, mentre la versione tecnica completa è ospitata su arXiv.
Lo steering globale causa effetti collaterali
L’activation steering modifica le rappresentazioni interne di un modello durante la generazione senza aggiornarne i pesi. I ricercatori hanno usato questa tecnica per ridurre il linguaggio tossico, indurre concetti, migliorare l’accuratezza fattuale e modificare il comportamento nella generazione di immagini. In genere, i metodi esistenti espongono un parametro globale di intensità, solitamente indicato con λ, che applica lo stesso intervento a un’intera sequenza di input o a un’immagine.
Questo trattamento uniforme comporta un compromesso. Uno steering più incisivo può sopprimere più efficacemente un comportamento indesiderato, ma può anche compromettere la fluidità, le prestazioni fattuali o generazioni non correlate. Nell’articolo, Apple illustra il problema con un semplice esempio: se si guida un modello ad allontanarsi da un concetto come la frutta, questo può alterare le risposte anche quando il prompt non ha nulla a che vedere con la frutta.
DSAS separa due decisioni che i metodi precedenti spesso combinano: quando applicare lo steering a un modello e come debba funzionare la trasformazione di steering. La mappa di steering continua a spostare le attivazioni verso un obiettivo desiderato, ma un gate separato stima quanto debba essere incisivo l’intervento per ciascun token o elemento spaziale.
DSAS usa un gate graduale anziché un’attivazione binaria
A ogni livello sottoposto a intervento, DSAS assegna a un’attivazione un valore compreso tra zero e uno. Un valore vicino a zero lascia l’attivazione quasi invariata; un valore vicino a uno applica per intero la trasformazione di steering. Il gate è prodotto da un regressore logistico addestrato a distinguere gli esempi di origine che presentano il comportamento indesiderato da un insieme di controllo che dovrebbe rimanere invariato.
I ricercatori di Apple usano le attivazioni medie di ogni esempio di addestramento per stimare i regressori, quindi applicano il classificatore ottenuto alle rappresentazioni dei singoli token durante l’inferenza. Prima dell’addestramento, l’analisi delle componenti principali riduce le dimensioni delle attivazioni. In seguito, il classificatore può essere ricondotto allo spazio di attivazione originale, così che l’inferenza non richieda un passaggio separato di proiezione.
Oltre agli esempi di origine e di destinazione, il metodo richiede un terzo gruppo di dati: i controlli. I dati di origine rappresentano il comportamento da cui il modello dovrebbe allontanarsi, quelli di destinazione il comportamento desiderato e quelli di controllo input neutri che dovrebbero mantenere il comportamento originale del modello. Negli esperimenti sulla tossicità, l’articolo usa 32 frasi tossiche di origine, 32 frasi non tossiche di destinazione e altre 32 frasi non tossiche di controllo.
Meno tossicità e perdite di capacità più contenute
La valutazione principale combina DSAS con tre tecniche di steering: Chinese Astron. Astrophys., ITI e LinEAS. I test riguardano Qwen 2.5 nelle versioni da 1,5 e 7 miliardi di parametri, oltre a Gemma 2 con 2 miliardi di parametri. I ricercatori misurano la tossicità sul benchmark TET, la perplexity su 20.000 frasi di Wikipedia e l’accuratezza a cinque esempi su MMLU.
In una delle configurazioni valutate, LinEAS combinato con DSAS registra punteggi di tossicità del 3,98% su Qwen 2.5 1.5B, del 2,26% su Gemma 2 2B e del 12,80% su Qwen 2.5 7B. I corrispondenti punteggi del solo LinEAS sono 9,78%, 6,50% e 15,57%. Nello stesso confronto, DSAS mantiene l’accuratezza su MMLU rispettivamente al 59,49%, 51,60% e 73,81%.
I risultati migliorano anche quando DSAS è abbinato agli altri metodi di steering. Chinese Astron. Astrophys. più DSAS raggiunge punteggi di tossicità dell’8,64% su Qwen 2.5 1.5B, del 3,48% su Gemma 2 2B e del 9,79% su Qwen 2.5 7B, contro il 13,67%, 4,51% e 14,19% del metodo di steering senza modifiche. ITI più DSAS riduce la tossicità rispetto al solo ITI su tutti e tre i modelli.
Gli autori confrontano DSAS con CAST, MERA e AlphaSteer, tre metodi che tentano anch’essi di intervenire in modo condizionale. La valutazione seleziona le configurazioni che mantengono la perplexity su Wikipedia entro un aumento del 5% e il punteggio su MMLU entro una diminuzione del 3% rispetto al modello originale. Apple riferisce che DSAS offre il miglior compromesso tra tossicità e prestazioni tra le combinazioni di modelli e metodi testate.
L’addestramento end-to-end estende l’approccio
Apple presenta anche E2E-DSAS, che addestra insieme il gate e la trasformazione di steering. La versione end-to-end si basa su LinEAS e aggiunge alla funzione di perdita un termine che preserva i controlli. Secondo l’articolo, senza quel termine il gate appreso tende ad applicare uno steering incisivo in modo generalizzato, avvicinandosi al comportamento del normale LinEAS.
Nella tabella riportata, LinEAS con DSAS end-to-end e un gate ReLU raggiunge un punteggio di tossicità del 5,18% su Qwen 2.5 1.5B, dell’1,64% su Gemma 2 2B e del 12,89% su Qwen 2.5 7B. I corrispondenti punteggi su MMLU sono 60,00%, 52,10% e 74,16%. La versione sigmoide ottiene risultati migliori in alcuni test su Gemma 2, ma non migliora allo stesso modo Qwen 2.5 7B.
Il controllo selettivo funziona anche nella generazione di immagini
DSAS non è limitato ai modelli linguistici autoregressivi. I ricercatori lo applicano al modello text-to-image a singolo passaggio DMD2, usando l’activation steering nei livelli di normalizzazione U-Net. Addestrano il sistema a sfocare le immagini che contengono uno di sei concetti segnaposto — banane, telefoni, castelli, mele, astronauti ed elefanti — lasciando le immagini non correlate vicine alle rispettive versioni senza modifiche.
Negli esempi dell’articolo, lo steering normale introduce sfocatura sia nei prompt pertinenti sia in quelli non pertinenti. DSAS concentra l’effetto sulle immagini associate al concetto selezionato. L’esperimento esclude CAST e MERA perché il primo presuppone una generazione autoregressiva, mentre il secondo non può usare i dati di controllo richiesti dalla configurazione per le immagini.
Il costo è contenuto, ma restano alcune ipotesi
DSAS aggiunge calcoli durante l’inferenza, anche se il sovraccarico misurato è modesto rispetto alla trasformazione di steering stessa. L’elaborazione di 100 token richiede 0,0269 secondi per Qwen 2.5 1.5B senza modifiche, 0,290 secondi con l’intervento di base Chinese Astron. Astrophys. e 0,0316 secondi con Chinese Astron. Astrophys. più DSAS. Su Gemma 2 2B, gli stessi valori sono 0,0489, 0,501 e 0,0520 secondi.
Gli autori riferiscono una riduzione della velocità di decodifica di circa il 5%-6% rispetto al metodo di steering di base su Qwen 2.5 1.5B, con un incremento più contenuto su Qwen 2.5 7B. Riconoscono inoltre che DSAS presuppone che il comportamento rilevante sia sufficientemente separabile nello spazio delle attivazioni da poter essere rilevato da un classificatore lineare. Se questa ipotesi non regge, può essere necessario un gate non lineare.
DSAS, quindi, non elimina la necessità di valutare e scegliere i dati di origine, di destinazione e di controllo. Aggiunge un meccanismo di controllo selettivo ai sistemi di steering esistenti, consentendo loro di intervenire con decisione sui contenuti problematici rilevati e in modo lieve, o per nulla, su tutto il resto. Il codice dell’articolo dovrebbe essere pubblicato su GitHub, ma la pagina di Apple non include ancora un link al repository.