Vai al contenuto
AI.info

Ricerca

RetireOPD: distillazione on-policy a ritiro autonomo per l’apprendimento per rinforzo degli agenti

Gli agenti multi-turno addestrati con l’apprendimento per rinforzo (RL) ricevono un’unica ricompensa scalare per traiettoria. Da qui nasce l’idea di usare l’autodistillazione on-policy (OPD) per forni

RetireOPD: distillazione on-policy a ritiro autonomo per l’apprendimento per rinforzo degli agenti
arXiv
2609.20784
Pubblicato
2026-09-17
Autori
Yan Yu, Zhengxi Lu, Yizhou Liu, Yichen Pan, Aozhe Wang, Qipeng Chen, Hua Yang, Wenqi Zhang, Weiming Lu, Qianglong Chen, Yongliang Shen

Abstract degli autori

Gli agenti multi-turno addestrati con l’apprendimento per rinforzo (RL) ricevono un’unica ricompensa scalare per traiettoria. Da qui nasce l’idea di usare l’autodistillazione on-policy (OPD) per fornire una supervisione dettagliata a livello di token tramite un insegnante basato sul modello stesso e dotato di competenze privilegiate per il compito, così che uno studente privo di tali competenze possa acquisirle. Questo approccio, tuttavia, è messo in discussione da due risultati nei compiti svolti da agenti: le sole informazioni privilegiate non rendono sempre affidabile un insegnante e il beneficio della sua supervisione dipende dalla fase dell’addestramento. Proponiamo quindi RetireOPD (distillazione on-policy a ritiro autonomo), che prima ottimizza con le ricompense dell’ambiente un insegnante separato, condizionato dalle competenze, e poi addestra uno studente privo di tali competenze combinando RL e OPD. Anziché seguire un programma di distillazione prestabilito, RetireOPD adotta Adaptive Retirement: lo studente abbandona autonomamente l’insegnante quando la discrepanza tra i due smette di ridursi e raggiunge una frazione prefissata del tasso di successo dell’insegnante. Da quel momento, l’addestramento prosegue con il solo RL. Nei modelli Qwen2.5 da 1,5B a 7B, RetireOPD migliora il tasso di successo su ALFWorld rispetto alla baseline RL dal 14,1% al 18,8% e l’accuratezza su WebShop dall’11,8% al 19,0%, superando il proprio insegnante condizionato dalle competenze in tutte le configurazioni.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv