Vai al contenuto
AI.info

Ricerca

Apprendimento orientato alle decisioni negli MDP: un approccio basato sulle misure di occupazione

In questo lavoro esaminiamo l’apprendimento orientato alle decisioni (DFL) per un processo decisionale di Markov (MDP). I metodi esistenti calcolano le derivate attraverso le condizioni KKT dell’equaz

Apprendimento orientato alle decisioni negli MDP: un approccio basato sulle misure di occupazione
arXiv
2610.08384
Pubblicato
2026-10-06
Autori
Zihao Zhao, Ashwath K. Karunakaram, Ali Eshragh, Yuexing Li, Kai Wang

Abstract degli autori

In questo lavoro esaminiamo l’apprendimento orientato alle decisioni (DFL) per un processo decisionale di Markov (MDP). I metodi esistenti calcolano le derivate attraverso le condizioni KKT dell’equazione di Bellman e richiedono di risolvere un sistema lineare che coinvolge tutte le coppie stato-azione, limitando così la loro scalabilità. Per superare questo limite, riformuliamo l’MDP come un problema di programmazione lineare (LP) basato sulle misure di occupazione, la cui regione ammissibile è determinata dalle dinamiche previste. Ricaviamo poi un gradiente in forma chiusa individuando i vincoli attivi nel poliedro ammissibile mediante l’algoritmo di pivot. Questo livello LP basato sulle misure di occupazione presenta due difficoltà: (1) il gradiente della soluzione dell’LP è discontinuo quando cambiano i vincoli attivi e (2) il costo della retropropagazione dell’LP continua a crescere con la dimensione dello spazio degli stati, risultando elevato per spazi degli stati grandi o continui. Affrontiamo queste difficoltà con un surrogato lagrangiano aumentato, attenuando i salti al confine mediante lo sketching casuale delle righe dei vincoli, e con un livello apprendibile di aggregazione soft degli stati e la sua generalizzazione tramite approssimazione di funzioni, che rendono l’LP scalabile per MDP con spazi degli stati finiti di grandi dimensioni o continui. In diversi compiti, i nostri metodi ottengono un regret inferiore rispetto al DFL basato sulle condizioni KKT e ai metodi di riferimento a due fasi, con un costo computazionale significativamente più basso. Il codice sorgente di tutti gli esperimenti è disponibile all’indirizzo https://github.com/A-Eshragh/State_Aggregation_Project.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv