Vai al contenuto
AI.info

Ricerca

Ottimizzazione delle policy adattiva alla difficoltà e strutturata ad albero per ampliare la copertura del ragionamento nell’RLVR

L’apprendimento per rinforzo con ricompense verificabili (RLVR) è stato centrale per i recenti successi dei grandi modelli di ragionamento. Tuttavia, pur migliorando notevolmente l’accuratezza su un s

Ottimizzazione delle policy adattiva alla difficoltà e strutturata ad albero per ampliare la copertura del ragionamento nell’RLVR
arXiv
2609.08650
Pubblicato
2026-09-08
Autori
Youngjun Yu, Sanghwan Jang, Hwanjo Yu

Abstract degli autori

L’apprendimento per rinforzo con ricompense verificabili (RLVR) è stato centrale per i recenti successi dei grandi modelli di ragionamento. Tuttavia, pur migliorando notevolmente l’accuratezza su un singolo campione, l’RLVR spesso non riesce ad ampliare la copertura intrinseca del ragionamento del modello (pass@k), a causa della limitata esplorazione durante l’addestramento. Per affrontare questo problema, ottimizziamo la struttura dei rollout nella fase di addestramento per migliorare pass@k. La nostra analisi individua tre principi fondamentali: (1) i rollout adattivi alla difficoltà possono svolgere un ruolo importante nell’ampliare pass@k, oltre a fungere da euristica per l’efficienza; (2) i rollout basati su alberi superano il campionamento parallelo nella scoperta di risposte corrette; e (3) la ramificazione guidata dall’entropia delle frasi supera il fenomeno di localizzazione della ramificazione a livello di token, massimizzando la diversità semantica. Sulla base di queste osservazioni, proponiamo DATPO (Difficulty-Adaptive Sentence-entropy-guided Tree-structured Policy Optimization). DATPO integra una ricerca ad albero adattiva alla difficoltà con un termine di vantaggio basato sulla diversità tra rami fratelli, promuovendo esplicitamente la diversità semantica per ampliare la copertura del ragionamento durante l’addestramento. Esperimenti su benchmark di ragionamento matematico dimostrano che DATPO supera le baseline soprattutto in termini di pass@k, il che si traduce direttamente in prestazioni superiori nello scaling in fase di test.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv