Vai al contenuto
AI.info

Ricerca

Un sintomo, tre leve: una rassegna critica dell’autodistillazione on-policy

La distillazione on-policy addestra un modello linguistico sulle proprie generazioni, mentre un modello insegnante le valuta token per token. Combina la supervisione capillare dell’apprendimento per i

Un sintomo, tre leve: una rassegna critica dell’autodistillazione on-policy
arXiv
2608.25936
Pubblicato
2026-08-26
Autori
Justin Robert, Raheel Qader

Abstract degli autori

La distillazione on-policy addestra un modello linguistico sulle proprie generazioni, mentre un modello insegnante le valuta token per token. Combina la supervisione capillare dell’apprendimento per imitazione con il campionamento on-policy dell’apprendimento per rinforzo. Richiede però un secondo modello, più grande, che faccia da insegnante. L’On-Policy Self-Distillation (OPSD) elimina questo costo. Il modello insegnante è il modello stesso, a cui vengono fornite informazioni privilegiate che il modello studente non avrà al momento del test, come una soluzione di riferimento, un piano o un feedback dall’ambiente. L’insegnante non è più capace dello studente: è solo meglio informato. I primi risultati erano promettenti, con un’accuratezza paragonabile a quella dell’apprendimento per rinforzo usando una frazione dei token generati. Ma la stessa asimmetria che produce il segnale introduce anche una distorsione. Oggi una modalità di fallimento domina questo campo: il collasso, ossia il progressivo restringimento dell’insieme dei percorsi di ragionamento che il modello è in grado di produrre. Il collasso non è specifico dell’OPSD, anche se le informazioni privilegiate lo aggravano. Questa rassegna considera il collasso un sintomo governato da tre leve: (i) dove viene applicato il segnale, cioè come vengono pesati i token; (ii) che cosa viene mostrato al modello insegnante, cioè la natura delle informazioni privilegiate; e (iii) quando cambia il segnale, cioè la dinamica del modello insegnante e la graduale riduzione della guida. Limitiamo l’analisi al ragionamento matematico, ambito in cui il metodo è nato e in cui le sue modalità di fallimento sono meglio documentate. Non presentiamo nuovi esperimenti. Il contributo è strutturale: un vocabolario comune per fenomeni chiamati in modi diversi nei vari articoli e una distinzione chiara tra ciò che è assodato e ciò che è ancora dibattuto.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv