Vai al contenuto
AI.info

Ricerca

DataFlex-RL: una piattaforma di valutazione per le politiche dei dati nell’RLVR

Le politiche dei dati per l’apprendimento per rinforzo con ricompense verificabili (RLVR) determinano quali rollout vengono utilizzati, quale peso viene loro attribuito e quali domini contribuiscono a

DataFlex-RL: una piattaforma di valutazione per le politiche dei dati nell’RLVR
arXiv
2609.06107
Pubblicato
2026-09-05
Autori
Hao Liang, Mingrui Chen, Hengyi Feng, Meiyi Qiang, Wentao Zhang

Abstract degli autori

Le politiche dei dati per l’apprendimento per rinforzo con ricompense verificabili (RLVR) determinano quali rollout vengono utilizzati, quale peso viene loro attribuito e quali domini contribuiscono ai successivi batch di addestramento. Presentiamo DataFlex-RL, una piattaforma di valutazione che permette di confrontare queste scelte usando una stessa procedura GRPO. Il nostro esperimento principale valuta 13 configurazioni su 12 semi abbinati, usando Qwen2.5-7B-Base e 12 benchmark di matematica, logica e scienze. Il GRPO uniforme aumenta l’accuratezza media bilanciata tra domini di 7,76 punti percentuali rispetto al checkpoint non addestrato. Nessuno degli otto metodi di selezione o ripesatura dei rollout ottiene, rispetto al campionamento uniforme, un intervallo di confidenza appaiato al 95% che escluda lo zero; nessuna delle tre miscele adattive supera una miscela fissa in parti uguali allo stesso livello di precisione. Un’estensione corretta con 12 semi su Llama-3.1-8B-Base colloca i metodi aggiuntivi sulla stessa scala dei punteggi dei controlli originali, ma non fa emergere un vincitore costante in termini di prestazioni medie osservate. Quantifichiamo inoltre la sensibilità della valutazione ricalcolando i punteggi di nove esecuzioni di Qwen2.5-7B-Instruct con una sintesi basata su sei benchmark, prevalentemente matematici, composta da cinque benchmark di matematica e GPQA-Diamond, ma da nessun benchmark di logica, e confrontandola con la sintesi bilanciata tra domini basata su 12 benchmark. Le classifiche risultanti sono correlate negativamente, con un coefficiente di correlazione di -0,33, mentre le sintesi che mantengono tutti i 12 benchmark sono in larga misura concordi. Nelle condizioni controllate qui studiate, cambiare la politica dei dati modifica in modo misurabile il processo di addestramento, ma non produce un miglioramento riproducibile rispetto all’addestramento uniforme.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv