Vai al contenuto
AI.info

Ricerca

AdviSD: imparare a consigliare gli LLM di frontiera con l’autodistillazione mirata su più turni

Un piccolo consulente addestrabile può guidare un esecutore basato su un modello linguistico i cui parametri sono congelati, fornendogli consigli in linguaggio naturale. Oltre ad apprendere dalle rico

AdviSD: imparare a consigliare gli LLM di frontiera con l’autodistillazione mirata su più turni
arXiv
2609.38142
Pubblicato
2026-09-29
Autori
Rishabh Agrawal, Hejie Cui, Shasha Li, Shanchan Wu, Sercan Ö. Arık

Abstract degli autori

Un piccolo consulente addestrabile può guidare un esecutore basato su un modello linguistico i cui parametri sono congelati, fornendogli consigli in linguaggio naturale. Oltre ad apprendere dalle ricompense dei compiti, il consulente può usare il feedback sulle interazioni concluse per migliorare i propri consigli. Tuttavia, una correzione plausibile non cambia necessariamente l’esecuzione, mentre apprendere da correzioni di questo tipo può comunque influire sulle decisioni future del consulente in altri contesti. In un modello a parametri condivisi, dimostriamo che tali correzioni possono limitare l’apprendimento se i loro target favoriscono i consigli utili meno di quanto facciano i target di altre correzioni. Selezionarle meno spesso delle altre migliora le prestazioni finali del modello rispetto all’apprendimento da ogni correzione. Su questa base, il nostro metodo, Advisor Self-Distillation (AdviSD), combina l’apprendimento per rinforzo basato sui risultati con l’autodistillazione selettiva da una copia del consulente condizionata dal feedback. Una fase di riflessione propone correzioni; il consulente assegna poi un punteggio alla stessa risposta registrata dell’esecutore, con e senza il consiglio che aveva fornito, e usa l’entità della differenza per selezionare le decisioni da usare come supervisione. Questo approccio non richiede né le verosimiglianze dell’esecutore né rollout aggiuntivi dell’esecutore. Esperimenti con consulenti Qwen3-8B per Gemini e Claude mostrano che AdviSD supera advisor-GRPO di 4,2-6,4 punti percentuali su BFCL-v3 e di 3,9-5,1 punti di punteggio su EnvScaler. I consulenti addestrati generalizzano a compiti fuori dominio e si trasferiscono tra diverse versioni degli esecutori e famiglie di modelli. AdviSD supera anche una selezione casuale di pari numerosità, a sostegno dell’utilità della sua regola di selezione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv