Ricerca
Ottimizzazione della politica di Bellman
L’apprendimento per rinforzo con ricompense verificabili (RLVR) migliora le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM). Presentiamo Bellman Policy Optimization (BPO),

- arXiv
- 2609.15987
- Pubblicato
- 2026-09-14
- Autori
- Zhuoqing Song, Haotian Xu, Xikun Zhang, Lidong Bing
Abstract degli autori
L’apprendimento per rinforzo con ricompense verificabili (RLVR) migliora le capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM). Presentiamo Bellman Policy Optimization (BPO), un metodo senza critico derivato da Policy Mirror Descent (PMD). Per la generazione autoregressiva con ricompense terminali, BPO usa le equazioni di Bellman per riformulare PMD come un obiettivo a livello di traiettoria. Questa riformulazione evita di stimare i valori degli stati intermedi. Dimostriamo che ha la stessa soluzione ottimale unica dell’obiettivo PMD originale. Deriviamo la loss pratica di BPO approssimando questo obiettivo. Il suo peso di correzione del disallineamento è un rapporto smussato tra probabilità complementari dei token. Gli esperimenti sui benchmark di ragionamento matematico dimostrano l’efficacia di BPO.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv