Ricerca
Apprendere dai completamenti del modello insegnante a partire dagli stati dello studente
Presentiamo OLIVE (OnLine InterVEntion). A ogni iterazione, la politica dello studente, che evolve nel corso dell’addestramento, genera un nuovo prefisso; il modello insegnante lo prosegue in modo aut

- arXiv
- 2609.36246
- Pubblicato
- 2026-09-28
- Autori
- Haojin Wang, Dylan Zhang, Huaibo Chen, Suhao Yu, Yihang Sun, Zhanyang Jin, Jiaying Ye, Dianqi Li, Prasanna Sattigeri, Kamal Youcef-Toumi, Hao Peng
Abstract degli autori
Presentiamo OLIVE (OnLine InterVEntion). A ogni iterazione, la politica dello studente, che evolve nel corso dell’addestramento, genera un nuovo prefisso; il modello insegnante lo prosegue in modo autoregressivo e lo studente viene aggiornato mediante l’entropia incrociata calcolata sui token generati dall’insegnante. Ogni scelta progettuale affronta un limite dei metodi di distillazione esistenti: (1) lo spostamento sequenziale della distribuzione delle covariate nel fine-tuning supervisionato offline (SFT) su traiettorie fisse dell’insegnante, (2) la supervisione frammentata quando il prefisso fallisce nella distillazione on-policy a livello di token (OPD) e (3) la necessità di accedere alle probabilità dei token dell’insegnante nella distillazione basata sulla corrispondenza delle distribuzioni. OLIVE ottiene prestazioni di ragionamento superiori a OPD (con un’approssimazione top-16 della divergenza KL) a un costo comparabile in ore-GPU. La nostra implementazione asincrona riduce ulteriormente del 23,8\% il tempo totale di addestramento di OLIVE. Valutiamo OLIVE sia su compiti di ragionamento difficili sia su compiti agentici, che rispecchiano gli scenari moderni di post-addestramento: a parità di budget di addestramento, supera costantemente i metodi di distillazione esistenti. Rigenerando i prefissi a partire dallo studente man mano che evolve, OLIVE continua a migliorare anche dopo che la distillazione offline ha raggiunto un plateau, preservando meglio le capacità generali e la plasticità dello studente. Utilizzando soltanto testi di GPT-5.4-mini, l’addestramento continuo con OLIVE supera del 13\% su ScienceWorld il SFT offline basato sullo stesso insegnante. Questi risultati indicano che OLIVE è un approccio efficace ed efficiente alla distillazione online dei modelli linguistici.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv