Vai al contenuto
AI.info

Ricerca

PivotOPD: imparare a riprendersi dagli errori decisivi negli agenti che interagiscono su più turni

La distillazione on-policy (OPD) è un approccio promettente per addestrare agenti linguistici: fornisce una supervisione dettagliata da parte di un modello insegnante sulle traiettorie generate dal mo

PivotOPD: imparare a riprendersi dagli errori decisivi negli agenti che interagiscono su più turni
arXiv
2609.40285
Pubblicato
2026-09-30
Autori
Yinghui He, Yapei Chang, Khushi Bhardwaj, Daniele Molinari, Tugrul Konuk, Jan Kautz, Ali Hatamizadeh

Abstract degli autori

La distillazione on-policy (OPD) è un approccio promettente per addestrare agenti linguistici: fornisce una supervisione dettagliata da parte di un modello insegnante sulle traiettorie generate dal modello studente. Tuttavia, nelle interazioni su più turni, un’azione errata cambia gli stati che lo studente incontra in seguito, facendo accumulare gli errori da un turno all’altro. In esperimenti preliminari condotti su tre modelli Qwen3 (da 8B a 235B), rileviamo che più della metà dei rollout falliti contiene un errore decisivo, ossia un’azione che allontana l’agente dal completamento del compito, e che questo errore si verifica di solito nelle prime fasi. Spesso è ancora possibile rimediare a questi errori decisivi: guidare il modello anche solo per pochi turni dopo quello decisivo può consentirgli di completare il compito. Proponiamo quindi PivotOPD, un framework di distillazione on-policy che addestra lo studente sia a evitare gli errori decisivi sia a riprendersi dagli stati che essi producono. Per ogni errore decisivo, un modello insegnante fornisce un’azione corretta e indica poi un’azione di recupero per ciascuno dei pochi turni successivi. La distillazione preventiva usa l’azione corretta con la KL inversa per allontanare lo studente dall’errore decisivo, mentre la distillazione per il recupero usa le azioni di recupero con la KL diretta per trasferire comportamenti di recupero che lo studente campiona raramente. Nel confronto con 13 baseline su ALFWorld, WebShop e Search-based QA, PivotOPD ottiene le migliori prestazioni medie sia con Qwen3-1.7B sia con Qwen3-8B come modelli studenti, superando la baseline migliore su ALFWorld del +5,5% con il modello studente da 1,7B. I miglioramenti si trasferiscono anche a un’altra famiglia di modelli nell’ambito dell’ingegneria del software, dove PivotOPD aumenta del +3,2% il tasso di risoluzione di un modello studente Nemotron-3.5 su SWE-Bench Verified. Pagina del progetto: https://research.nvidia.com/labs/lpr/pivotopd/

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv