Ricerca
Geometria dello steering: verificare la geometria dei valori umani nello spazio di steering degli LLM
Con la crescente diffusione dei modelli linguistici di grandi dimensioni (LLM) in contesti in cui l’allineamento è cruciale, l’activation steering si è affermato come alternativa leggera, applicabile

- arXiv
- 2609.06289
- Pubblicato
- 2026-09-05
- Autori
- Mohammad Mahdi Abootorabi, Armin Saghafian, Ali Bazshoushtari, Hamid Rezaei, EunJeong Hwang, Vered Shwartz, Parvin Mousavi, Purang Abolmaesumi
Abstract degli autori
Con la crescente diffusione dei modelli linguistici di grandi dimensioni (LLM) in contesti in cui l’allineamento è cruciale, l’activation steering si è affermato come alternativa leggera, applicabile durante l’inferenza, ai metodi di fine-tuning (per esempio RLHF e DPO) per controllare il comportamento dei modelli. Tuttavia, gli studi esistenti in genere verificano l’efficacia dello steering su comportamenti isolati: non è quindi chiaro se i vettori di steering codifichino una struttura semantica coerente o sfruttino semplicemente scorciatoie specifiche per ciascun comportamento. Esaminiamo se la geometria latente dei vettori di steering degli LLM rispecchi la struttura dei valori umani e della moralità prevista dalla teoria. Adottando la Theory of Basic Human Values di Schwartz come principale quadro di riferimento dettagliato, introduciamo un benchmark di 26K campioni che copre 20 valori umani e analizziamo metodi basati sulla distribuzione (per esempio CAA, SphericalSteer e ODESteer) e approcci incentrati sul comportamento (per esempio COLD-Steer e BiPO) su famiglie di modelli di diverse dimensioni. Riscontriamo che i metodi basati sulla distribuzione ricostruiscono topologie dei valori umani in linea con le previsioni teoriche (coefficiente di Spearman per $ρ$ fino a 0,51, $p < 10^{-13}$). Per contro, i metodi incentrati sul comportamento ottengono prestazioni di steering comparabili, ma mostrano una scarsa correlazione con la geometria dei valori attesa. La fedeltà geometrica migliora all’aumentare delle dimensioni del modello, ma diminuisce dopo l’instruction tuning. Infine, un migliore allineamento geometrico porta anche a un trasferimento tra valori più coerente con quello umano: lo steering di un valore rafforza correttamente i valori compatibili e attenua quelli opposti. Codice e dati sono disponibili all’indirizzo: https://github.com/DeepRCL/Steering_Geometry.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv