Vai al contenuto
AI.info

Ricerca

Apprendimento per rinforzo offline a $n$ passi avverso alla varianza per ambienti a orizzonte lungo con ricompense sparse

Gli attori generativi stanno trasformando l’apprendimento per rinforzo (RL) offline, rendendo possibili classi di policy espressive, capaci di modellare distribuzioni complesse delle azioni. Questa es

Apprendimento per rinforzo offline a $n$ passi avverso alla varianza per ambienti a orizzonte lungo con ricompense sparse
arXiv
2610.07899
Pubblicato
2026-10-06
Autori
Guhyeon Kang, Minhae Kwon

Abstract degli autori

Gli attori generativi stanno trasformando l’apprendimento per rinforzo (RL) offline, rendendo possibili classi di policy espressive, capaci di modellare distribuzioni complesse delle azioni. Questa espressività, tuttavia, mette in luce una sfida fondamentale nei dataset eterogenei: le policy generative possono riprodurre modalità d’azione inaffidabili, le cui distribuzioni dei ritorni presentano un’elevata varianza. Tali azioni possono produrre occasionalmente ritorni elevati per caso, ma non offrono risultati costanti. Di conseguenza, massimizzare soltanto il valore atteso di $Q$ non basta a individuare azioni affidabili. Proponiamo VAN-Flow (Variance-Averse $n$-step Flow), un framework che favorisce le azioni affidabili nell’apprendimento per rinforzo offline generativo. VAN-Flow combina (i) un critico distribuzionale categoriale, (ii) un operatore di valore atteso avverso alla varianza, che ripesa gradualmente le probabilità degli atomi per favorire azioni con ritorni elevati e bassa dispersione, e (iii) un attore generativo basato sul flow matching, guidato mediante campionamento per rigetto. A differenza del CVaR o delle funzioni obiettivo media-varianza, l’operatore redistribuisce la massa di probabilità nella distribuzione categoriale dei ritorni senza troncamenti netti né termini di penalità ausiliari. In oltre 40 task tratti da D4RL e OGBench, VAN-Flow supera sistematicamente solide baseline, con i maggiori miglioramenti nei contesti a orizzonte lungo e ad alta varianza, in cui la scelta di azioni affidabili diventa cruciale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv