Vai al contenuto
AI.info

Ricerca

Geometria dei valori: composizione di vettori di task per l’allineamento delle preferenze etiche nei modelli linguistici

I grandi modelli linguistici (LLM) vengono impiegati sempre più spesso in applicazioni che devono soppesare valori morali in conflitto, ma anche i modelli più potenti mostrano pregiudizi nascosti e un

Geometria dei valori: composizione di vettori di task per l’allineamento delle preferenze etiche nei modelli linguistici
arXiv
2609.21094
Pubblicato
2026-09-17
Autori
Utkarsh Agarwal, Monojit Choudhury

Abstract degli autori

I grandi modelli linguistici (LLM) vengono impiegati sempre più spesso in applicazioni che devono soppesare valori morali in conflitto, ma anche i modelli più potenti mostrano pregiudizi nascosti e una capacità fragile di seguire le istruzioni nelle diverse lingue. Presentiamo un dataset di 12.000 dilemmi con due possibili opzioni, che copre tre conflitti tra coppie di valori: onestà contro giustizia, giustizia contro autonomia e autonomia contro onestà. Il dataset include anche le traduzioni in hindi, arabo, spagnolo e cinese, per analizzare il comportamento cross-lingua. I benchmark condotti su GPT-5-mini rivelano che, in assenza di una policy, il modello preferisce sistematicamente l’onestà all’autonomia in tutte e cinque le lingue. I modelli Llama-3.2-1/3B mostrano una forte propensione per la prima opzione; tuttavia, sia il fine-tuning standard sia il fine-tuning con Direct Preference Optimization eliminano efficacemente questa propensione, portando l’accuratezza oltre il 98%. Per distinguere l’effetto dell’apprendimento delle correlazioni presenti nel dataset da quello dei valori astratti, proponiamo un esperimento basato sul trasferimento di vettori di task: dopo aver calcolato i vettori di task per una direzione di preferenza valoriale, li ortogonalizziamo rispetto al vettore generale di esecuzione delle istruzioni. Il nostro esperimento mostra che questo metodo consente di isolare la direzione della preferenza per uno specifico valore, che può essere usata con successo per eseguire l’aritmetica dei task e ottenere un modello con una posizione opposta.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv