Ricerca
Bloccati all’ingresso, liberi all’interno: dove RLVR restringe lo spazio delle soluzioni
L’apprendimento per rinforzo con ricompense verificabili (RLVR) migliora notevolmente l’accuratezza con un solo tentativo (pass@1), ma restringe lo spazio delle soluzioni della policy, riducendo i ben

- arXiv
- 2608.29188
- Pubblicato
- 2026-08-29
- Autori
- Qiancheng Zhou, Ruizhe Li
Abstract degli autori
L’apprendimento per rinforzo con ricompense verificabili (RLVR) migliora notevolmente l’accuratezza con un solo tentativo (pass@1), ma restringe lo spazio delle soluzioni della policy, riducendo i benefici dell’aumento delle risorse impiegate al momento dell’inferenza. In questo lavoro esaminiamo in quale punto di una traiettoria di ragionamento si perde questa varietà: la policy non riesce ad accedere a una famiglia di soluzioni valide oppure non riesce a eseguire i calcoli una volta avviati? Per distinguere l’accesso dall’esecuzione, analizziamo il compito Countdown, il cui spazio delle soluzioni può essere enumerato esaustivamente in famiglie d’ingresso distinte, definite dal primo operando e dal primo operatore, usando PPO su Qwen2.5-3B e GRPO su Qwen2.5-3B-Instruct. In entrambe le configurazioni di addestramento, la copertura delle soluzioni cala fino al 67% e si dimezza persino nei problemi risolti in tutti i checkpoint. Mostriamo che questa contrazione si concentra soprattutto all’ingresso: le variazioni della verosimiglianza per token sono 11–16 volte maggiori prima della prima operazione aritmetica che durante il ragionamento successivo. Fornire soltanto un prefisso d’ingresso non selezionato aumenta di oltre un ordine di grandezza i tassi di completamento nelle famiglie a basso accesso (da 0,018 a 0,212 con PPO), dimostrando che le soluzioni alternative restano eseguibili, ma non vengono più avviate. Sulla base di questa localizzazione, riscontriamo che, mentre i prompt superficiali non riescono a ripristinare la diversità, gli interventi mirati all’ingresso funzionano: l’interpolazione dei parametri degli strati finali con quelli dei checkpoint iniziali aumenta la copertura delle soluzioni del 37% senza ridurre pass@1. Infine, mostriamo che il crollo dell’entropia nei primi passaggi si ripresenta in sei benchmark matematici con modelli da 7B e 14B, ma non è una conseguenza inevitabile dell’ottimizzazione del ragionamento: una baseline SFT conserva una copertura più che doppia e le pipeline a fasi SFT--DPO--RLVR mantengono l’entropia nei primi passaggi. In sintesi, la varietà del ragionamento si perde sulla soglia, non all’interno della stanza. Codice: https://github.com/ershiyidian/early-branch-locking.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv