Vai al contenuto
AI.info

Ricerca

Ripensare la riponderazione dei token nel SFT: sopprimere, invertire ed estrapolare le caratteristiche apprese

Il fine-tuning supervisionato (SFT) apprende con maggiore intensità dai token che il modello ritiene meno probabili. Questo favorisce l’acquisizione di nuovi comportamenti, ma amplifica anche i segnal

Ripensare la riponderazione dei token nel SFT: sopprimere, invertire ed estrapolare le caratteristiche apprese
arXiv
2609.33463
Pubblicato
2026-09-27
Autori
Cunchun Li, Haonan He, Yifan Gao, Minglei Li, Jingqi Ye, Qingyu Yang, Peng Ye

Abstract degli autori

Il fine-tuning supervisionato (SFT) apprende con maggiore intensità dai token che il modello ritiene meno probabili. Questo favorisce l’acquisizione di nuovi comportamenti, ma amplifica anche i segnali di supervisione rumorosi o contrastanti e può sovrascrivere conoscenze utili acquisite durante il preaddestramento. Adottando una prospettiva unificata basata sulla funzione di perdita della policy, riesaminiamo i metodi esistenti di riponderazione dei token e mostriamo che assegnano coefficienti non negativi ai token presenti nelle dimostrazioni. Possono quindi attenuare o amplificare gli aggiornamenti supervisionati, ma non invertire le caratteristiche dannose una volta apprese. Inoltre, pesi di addestramento maggiori non equivalgono a un’estrapolazione delle caratteristiche, perché modificano la traiettoria dell’ottimizzazione anziché scalare una direzione SFT fissa. Sosteniamo che l’inversione e l’estrapolazione richiedano un quadro di riferimento stabile, definito da un delta SFT fisso. Su questa base proponiamo SCALE (Selective Control of Adaptation via Local Entropy), un metodo di controllo dell’intensità dell’adattamento guidato dall’entropia che mantiene fissi il modello preaddestrato e il delta SFT e apprende fattori di modulazione vincolati, specifici per token e per modulo, minimizzando soltanto l’entropia predittiva. Questi fattori sopprimono, invertono o estrapolano le caratteristiche SFT mantenute fisse in base al loro allineamento con la riduzione dell’entropia. Su Qwen2.5-Math-1.5B, Qwen2.5-Math-7B e Qwen3-4B-Base, SCALE ottiene medie di 37,84, 43,60 e 36,57 nel ragionamento matematico, superando i rispettivi metodi di riferimento più efficaci e restando competitivo nei benchmark sulla conservazione delle capacità generali. Ottiene inoltre le migliori prestazioni medie nella generazione di codice su HumanEval, HumanEval+ e MBPP per tutti e tre i modelli. Questi risultati suggeriscono che, per correggere efficacemente il SFT, possa essere utile controllare il modo in cui vengono impiegati i residui già appresi, anziché limitarsi a modificare il modo in cui vengono appresi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv