Vai al contenuto
AI.info

Ricerca

Self-OPD: distillazione on-policy per modelli di flow matching senza modello insegnante

La distillazione on-policy (OPD), che sfrutta un modello insegnante specializzato e preaddestrato per fornire segnali di supervisione dettagliati, ha ottenuto risultati significativi nei Large Languag

Self-OPD: distillazione on-policy per modelli di flow matching senza modello insegnante
arXiv
2608.26872
Pubblicato
2026-08-27
Autori
Shiyi Zhang, Mushui Liu, Yunze Tong, Wanggui He, Siyu Zou, Jinlong Liu, Yunlong Yu, Jian Song, Hao Jiang, Pipei Huang, Bo Zheng

Abstract degli autori

La distillazione on-policy (OPD), che sfrutta un modello insegnante specializzato e preaddestrato per fornire segnali di supervisione dettagliati, ha ottenuto risultati significativi nei Large Language Models (LLM) ed è stata recentemente adattata ai modelli di flow matching. Questo approccio presenta però due problemi principali. In primo luogo, addestrare un modello insegnante distinto e specifico per ogni nuovo obiettivo comporta costi computazionali elevati. In secondo luogo, la discrepanza tra le distribuzioni del modello insegnante e dello studente porta spesso ad accumulare errori lungo la traiettoria di generazione. In questo articolo presentiamo \textbf{Self-OPD}, un approccio OPD per modelli di flow matching che non richiede un modello insegnante e trasforma l’esplorazione autonoma dello studente in supervisione passo per passo. A ogni passo temporale, Self-OPD ramifica la previsione deterministica dello stato successivo in $K$ candidati stocastici SDE, ne simula le traiettorie con il campionatore ODE e confronta le rispettive ricompense con una baseline deterministica basata sul modello stesso, ottenendo vantaggi normalizzati. Il campo di velocità viene ottimizzato mediante una funzione obiettivo di attrazione e repulsione che coinvolge tutti i rami: quelli con un vantaggio elevato attraggono lo studente, mentre quelli con un vantaggio basso lo respingono, con un’attenuazione che tiene conto della direzione e una normalizzazione rispetto alla varianza SDE. Per l’allineamento su più obiettivi, Self-OPD combina i punteggi normalizzati a livello delle ricompense, evitando conflitti diretti tra i gradienti. Gli esperimenti su benchmark con ricompense singole e miste mostrano che Self-OPD supera i precedenti metodi RL e OPD senza ricorrere a modelli insegnanti specifici per il compito.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv