Vai al contenuto
AI.info

Ricerca

Autodistillazione negativa: imparare a ragionare evitando gli errori

L’autodistillazione on-policy (OPSD) si è affermata come paradigma diffuso per il miglioramento autonomo dei modelli linguistici di grandi dimensioni (LLM): permette ai modelli di fungere da insegnant

Autodistillazione negativa: imparare a ragionare evitando gli errori
arXiv
2609.11699
Pubblicato
2026-09-10
Autori
Rongcan Pei, Zhepei Wei, Shuyao Xu, Xinyu Zhu, Wei-Lin Chen, Yu Meng

Abstract degli autori

L’autodistillazione on-policy (OPSD) si è affermata come paradigma diffuso per il miglioramento autonomo dei modelli linguistici di grandi dimensioni (LLM): permette ai modelli di fungere da insegnanti di sé stessi sfruttando informazioni privilegiate, come le soluzioni corrette. Risultati recenti indicano però che l’OPSD può peggiorare gravemente le prestazioni degli LLM nei compiti di ragionamento complessi. Costringendo il modello studente a imitare una sequenza di ragionamento artificiosamente sicura di sé, condizionata da informazioni privilegiate, l’OPSD finisce per sopprimere le espressioni di incertezza e penalizzare i comportamenti esplorativi e autocorrettivi necessari per risolvere problemi difficili. Per affrontare questo limite, presentiamo l’autodistillazione negativa (NSD), un nuovo metodo che ottimizza gli LLM allontanandoli dai ragionamenti difettosi anziché inducendoli a imitare soluzioni privilegiate. Invece di basarsi su risposte corrette o su una supervisione esterna, l’NSD usa il modello stesso per generare una condizione negativa specifica per ciascuna domanda, per esempio comportarsi come un «ragionatore poco attento», e spinge la distribuzione del modello studente ad allontanarsi da quella di questo insegnante negativo generato dal modello stesso. Applicare direttamente obiettivi di disapprendimento per ottenere tale divergenza è problematico: i token del ragionamento difettoso si confondono con i token linguistici di base, e penalizzare indiscriminatamente entrambi rischia di compromettere gravemente le capacità linguistiche fondamentali del modello. Risolviamo il problema progettando un meccanismo di selezione dinamica che individua e isola automaticamente i token cruciali per il ragionamento, assicurando che gli aggiornamenti dei gradienti intervengano solo sui difetti comportamentali e preservino le conoscenze linguistiche pregresse del modello. Nei risultati empirici, l’NSD supera sistematicamente l’OPSD e altri metodi di riferimento di apprendimento per rinforzo (RL) senza etichette e basati sull’autoavviamento.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv