Ricerca
Oltre i timestamp: distillazione on-policy allineata alle decisioni per agenti a lungo orizzonte
L’apprendimento per rinforzo con ricompense verificabili (RLVR) si basa spesso su ricompense legate all’esito poco frequenti, che offrono una supervisione grossolana per gli agenti a lungo orizzonte.

- arXiv
- 2609.33391
- Pubblicato
- 2026-09-27
- Autori
- Mingju Chen, Can Lv, Jinrong Liu, Huan Zhang, Heng Chang, Shiji Zhou
Abstract degli autori
L’apprendimento per rinforzo con ricompense verificabili (RLVR) si basa spesso su ricompense legate all’esito poco frequenti, che offrono una supervisione grossolana per gli agenti a lungo orizzonte. La distillazione di sé on-policy (OPSD) integra questo segnale con un feedback privilegiato fitto. Tuttavia, individuiamo il fenomeno \emph{Decision--Timestamp Mismatch}: le indicazioni privilegiate possono non essere allineate con la decisione funzionale dello studente, perché la decisione corrispondente può avvenire in un momento diverso, mentre la decisione dello studente può a sua volta estendersi su più momenti anziché essere legata a un singolo timestamp. Una supervisione circoscritta al timestamp può quindi disallineare sia il contesto sia l’estensione temporale dell’attribuzione del merito. Per affrontare questo disallineamento, introduciamo \textsc{AlignOPSD}, seguendo il principio di allineare la supervisione prima di attribuire il merito. Decision-Aligned Supervision Rectification riassegna un punteggio alla stessa risposta campionata dallo studente in contesti funzionalmente corrispondenti, tratti da traiettorie parallele, per calibrare le evidenze locali del modello insegnante. Semi-Markov Hierarchical Credit Assignment ricava poi intervalli decisionali di durata variabile dai cambiamenti nelle corrispondenze e usa le evidenze rettificate per distribuire il merito ancorato all’esito tra gli intervalli e i turni che li compongono. Valutiamo \textsc{AlignOPSD} con Qwen2.5-3B e Qwen2.5-7B su ALFWorld, WebShop e Search-QA, confrontandolo con metodi di riferimento rappresentativi. \textsc{AlignOPSD} supera sia GRPO sia StepOPSD in tutti gli otto confronti tra backbone e metriche aggregate, migliorando rispetto a GRPO del 5,5--8,7 \% e classificandosi primo in sei. Ulteriori analisi esaminano le due fasi di allineamento e la sensibilità agli iperparametri nei diversi compiti. Il nostro codice è disponibile all’indirizzo https://github.com/mingju-c/Align-OPSD
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv