Ricerca
PIVOT: pianificazione della transizione da KD a RL basata sulla perplessità per la distillazione few-shot nei domini verticali
La classificazione few-shot nei domini verticali resta difficile per i piccoli modelli linguistici: con una supervisione limitata, acquisire le conoscenze specifiche del dominio necessarie per prender
- arXiv
- 2610.11167
- Pubblicato
- 2026-10-08
- Autori
- Heng Li, Yong Zhang, Ning Cheng, Zhigen Li, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao
Abstract degli autori
La classificazione few-shot nei domini verticali resta difficile per i piccoli modelli linguistici: con una supervisione limitata, acquisire le conoscenze specifiche del dominio necessarie per prendere decisioni è complicato. La distillazione on-policy (On-Policy Distillation, OPD) può migliorare l’adattamento guidato dal modello insegnante fornendo supervisione ai rollout generati dal modello studente, mentre l’apprendimento per rinforzo basato su GRPO può affinare ulteriormente le predizioni downstream. Tuttavia, le pipeline esistenti che passano da KD a RL si affidano in genere a programmi di transizione fissi per tutti i campioni, ignorando che campioni diversi possono richiedere quantità diverse di apprendimento guidato dal modello insegnante prima dell’affinamento basato sulla ricompensa. Proponiamo PIVOT (Perplexity-Informed Transition Optimization), un sistema di transizione dinamico che assegna i campioni a OPD o GRPO in base alla perplessità della sequenza valutata dal modello insegnante. PIVOT trasferisce i campioni a bassa perplessità a GRPO per l’affinamento basato sulla ricompensa, mantenendo quelli ad alta perplessità in OPD affinché continuino ad acquisire conoscenze del dominio. Gli esperimenti su Banking77 e HWU64 mostrano che PIVOT supera sistematicamente sia la prosecuzione di OPD sia le soluzioni di riferimento con transizione da OPD$\rightarrow$GRPO sincronizzata per tutti i campioni, a parità di passi di ottimizzazione del modello studente dopo il warm-up, ottenendo prestazioni downstream migliori e dinamiche di addestramento più stabili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv