Vai al contenuto
AI.info

Ricerca

Favorire la generalizzazione dal debole al forte con la distillazione inversa on-policy

La generalizzazione dal debole al forte pone una domanda: i modelli più potenti possono apprendere da supervisori più deboli e superarli? La questione è particolarmente importante per le generazioni s

Favorire la generalizzazione dal debole al forte con la distillazione inversa on-policy
arXiv
2609.08798
Pubblicato
2026-09-08
Autori
Youngrok Park, Sangmin Bae, Hojung Jung, Jongwoo Ko, Yunseon Choi, Young Jin Kim, Pashmina Cameron, Aaron Courville, Se-Young Yun

Abstract degli autori

La generalizzazione dal debole al forte pone una domanda: i modelli più potenti possono apprendere da supervisori più deboli e superarli? La questione è particolarmente importante per le generazioni successive di modelli e per il consolidamento multidominio, contesti in cui ripetere da zero il post-training su scala dei modelli di frontiera può essere proibitivamente costoso. La distillazione convenzionale, però, tratta l’insegnante più debole come obiettivo dell’ottimizzazione, rischiando di imporre allo studente il limite delle sue capacità. Presentiamo On-Policy Reverse Distillation (OPRD), un metodo che valuta, sui rollout dello studente, lo spostamento della politica dell’insegnante rispetto alla sua politica di riferimento e amplifica la componente del gradiente della politica dello studente guidato dal verificatore che segue quella direzione. Ricalibrando soltanto gli aggiornamenti supportati dal verificatore, OPRD preserva i punti stazionari dell’ottimizzazione della politica e accelera al tempo stesso l’apprendimento oltre il livello dell’insegnante. Sia nel trasferimento tra generazioni successive di modelli sia nella distillazione con più insegnanti, OPRD raggiunge prestazioni superiori con meno aggiornamenti dello studente rispetto agli approcci esistenti basati su RL e distillazione. L’analisi dello stile delle risposte mostra che gli studenti OPRD rimangono più vicini ai modelli addestrati soltanto con RL basato su un verificatore che ai loro insegnanti più deboli: ciò suggerisce che la guida dell’insegnante acceleri l’ottimizzazione dello studente, anziché reindirizzarla. I risultati nella distillazione convenzionale dal forte al debole mostrano inoltre che OPRD combina efficacemente l’ottimizzazione della politica guidata dal verificatore con la guida dell’insegnante, indipendentemente dall’ordine delle rispettive capacità.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv