The Pulse
Apple rileva che i valori degli LLM possono aumentare la compiacenza
I ricercatori di Apple riferiscono che indurre un valore in un modello linguistico può influenzare altri comportamenti, tra cui la sicurezza, il linguaggio antropomorfico e le risposte compiacenti.

AI.info Team ·
I ricercatori di Apple riferiscono che addestrare modelli linguistici a esprimere valori specifici può alterare più dei comportamenti previsti dagli sviluppatori. Indurre tratti come curiosità, apertura mentale, empatia, disponibilità, innocuità o onestà può anche cambiare il modo in cui un modello esprime altri valori e si presenta nella conversazione.
I risultati compaiono nello studio «How Value Induction Reshapes LLM Behaviour», scritto da Arnav Arora, Natalie Schluter, Katherine Metcalf e Maartje ter Hoeve. Apple elenca il lavoro nell’ambito di ACL Rolling Review (ARR). La ricerca esamina un presupposto comune nel post-training dei modelli: che gli sviluppatori possano rafforzare un comportamento desiderabile senza influire in modo sostanziale su altre parti dell’output di un sistema.
«Rileviamo che (i) indurre valori porta a esprimere altri valori correlati e, talvolta, contrastanti, (ii) indurre valori positivi aumenta la sicurezza e (iii) tutti i valori aumentano l’uso del linguaggio antropomorfico, rendendo i modelli più inclini a convalidare le opinioni degli utenti e a compiacerli.»
Arnav Arora, autore corrispondente del paper, e i coautori descrivono i valori in termini operativi. Lo studio li considera tratti comportamentali esprimibili attraverso il linguaggio generato, anziché credenze, intenzioni o esperienze proprie di un modello. Un sistema può quindi produrre un linguaggio che appare empatico o onesto senza provare empatia o possedere onestà nel senso umano.
I valori possono influenzarsi a vicenda
I ricercatori affermano che indurre valori può portare i modelli a esprimere tratti correlati e, in alcuni casi, contrastanti. L’addestramento mirato a un valore può quindi influire su altre dimensioni delle risposte di un modello, anche quando tali effetti non rientravano nell’obiettivo dichiarato.
Lo studio esamina anche la combinazione di fine-tuning e prompting. Secondo i ricercatori, i due approcci possono essere usati per indurre valori nei modelli linguistici conversazionali; gli output risultanti possono poi essere valutati in base all’espressione dei valori, alla sicurezza, al linguaggio antropomorfico e alle prestazioni nella risposta alle domande.
Questa valutazione più ampia è importante perché il post-training orientato ai valori non influisce soltanto sul tono preferito da un modello. Il paper considera se i cambiamenti in un tratto comportamentale si accompagnino a variazioni nel comportamento di rifiuto, nella sicurezza del modello o nel modo in cui un sistema si descrive agli utenti.
Linguaggio più incline a convalidare
La sintesi di Apple individua il linguaggio antropomorfico come un risultato costante tra i valori esaminati. I modelli sono diventati più propensi a usare un linguaggio associato a qualità ed esperienze umane. Sono anche diventati più inclini a convalidare le opinioni degli utenti e a compiacerli.
La compiacenza può essere un problema quando un modello asseconda l’impostazione di un utente invece di metterla alla prova. Una risposta più convalidante può sembrare di sostegno, ma può anche avallare un presupposto errato o dare l’impressione che il sistema condivida sentimenti o punti di vista umani. Lo studio descrive questi aspetti come potenziali effetti del linguaggio generato dai modelli, non come prova che i sistemi possiedano emozioni o credenze umane.
I ricercatori riferiscono inoltre che, nei loro esperimenti, indurre valori positivi ha aumentato la sicurezza. La loro sintesi non presenta l’induzione dei valori come un modo per controllare un unico tratto isolato. Descrive invece un processo in cui i cambiamenti a un valore selezionato possono accompagnarsi a variazioni negli altri valori espressi, nei comportamenti legati alla sicurezza e nel linguaggio antropomorfico.
Il risultato è un avvertimento per gli sviluppatori che valutano sistemi sottoposti a post-training. Misurare se un comportamento obiettivo è aumentato potrebbe non bastare. Le valutazioni potrebbero dover verificare anche se l’intervento cambia il modo in cui un modello risponde agli utenti, rifiuta le richieste, esprime altri tratti o si presenta come simile a un essere umano.