Ricerca
Dosaggio della persona: controllo calibrato delle attivazioni per modulare l’intensità dei tratti
Un coefficiente di controllo delle attivazioni determina la forza dell’intervento, ma per richiedere un determinato grado di espressione della persona serve una scala comportamentale. Studiamo il dosa

- arXiv
- 2609.36388
- Pubblicato
- 2026-09-28
- Autori
- Zehao Jin, Junran Wang, Ruixuan Deng, Jiahao Chen, Jingyuan Zhang, Yuxuan Zhang, Xinjie Shen
Abstract degli autori
Un coefficiente di controllo delle attivazioni determina la forza dell’intervento, ma per richiedere un determinato grado di espressione della persona serve una scala comportamentale. Studiamo il dosaggio della persona: il controllo di un modello linguistico attraverso la descrizione di un tratto e un’intensità media richiesta. PersonaDose specializza sulle risposte della persona un controller FLAS condiviso e condizionato dalla descrizione, poi ne calibra il tempo di flusso in base all’espressione misurata del tratto. Le risposte usate per l’addestramento non sono associate a intensità obiettivo richieste. Nei modelli Llama-3.1-8B, Qwen3-8B e Gemma-3-4B, alla soglia minima di coerenza di Persona Vectors pari a 75, PersonaDose aumenta l’espressione del tratto principale rispettivamente di 33,2, 18,3 e 17,8 punti rispetto all’aggiunta contrastiva delle attivazioni. Le impostazioni selezionate mediante calibrazione mantengono un vantaggio nell’espressione del tratto anche su domande non usate nell’addestramento, sebbene in quel caso la soglia minima di coerenza non sia rispettata per tutti i tratti. Su sette tratti usati nell’addestramento, le richieste calibrate producono errori medi nel raggiungimento dell’obiettivo di 4,7-6,2 punti, per 14-22 obiettivi raggiungibili mediante calibrazione sui 28 previsti per ciascun modello. Questi risultati distinguono l’intervallo di comportamenti appreso da un controller dalla precisione delle richieste all’interno di tale intervallo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv