Ricerca
FlowBalance: auto-miglioramento fondato sul verificatore a partire dall’esperienza di ragionamento on-policy
Un modello di ragionamento può migliorare grazie alla propria esperienza on-policy, ma questo ciclo interno è fragile: i verificatori dell’esito finale forniscono una supervisione affidabile ma scarsa

- arXiv
- 2609.03241
- Pubblicato
- 2026-09-03
- Autori
- Zixun Huang, Kishan Panaganti, Haitao Mi, Leowei Liang
Abstract degli autori
Un modello di ragionamento può migliorare grazie alla propria esperienza on-policy, ma questo ciclo interno è fragile: i verificatori dell’esito finale forniscono una supervisione affidabile ma scarsa, mentre le indicazioni dettagliate prodotte dallo stesso modello possono rafforzare una fiducia infondata o concentrare troppo l’apprendimento su un’unica modalità di soluzione. Presentiamo FlowBalance, un metodo di auto-miglioramento fondato sul verificatore che apprende una distribuzione normalizzata sulle risposte complete. Per ogni traiettoria on-policy, una versione congelata della stessa policy, usata durante l’addestramento, sfrutta un contesto privilegiato per produrre incrementi della log-probabilità a livello di token, poi aggregati in un punteggio di autoguida per l’intera traiettoria. FlowBalance calibra questo punteggio in base al vantaggio di gruppo derivato dal verificatore: le indicazioni vengono mantenute per le traiettorie con vantaggio positivo, invertite per quelle con vantaggio negativo e disattivate quando il gruppo di traiettorie generate non mostra alcuna preferenza tra gli esiti. L’energia risultante ripondera esponenzialmente una policy di riferimento, e il bilanciamento delle traiettorie profilato adatta la distribuzione obiettivo normalizzata usando una stima della log-partizione per ciascun gruppo di traiettorie generate. In questo modo, l’autoguida viene calibrata sugli esiti tramite il bilanciamento delle traiettorie, senza una funzione di perdita separata per l’imitazione a livello di token. La nostra analisi dimostra la conservazione dei contrasti all’interno dei gruppi, una caratterizzazione in termini di KL inversa a variazione minima, il controllo monotono della ricompensa obiettivo da parte del verificatore e una correzione esatta contro l’autoguida falsamente positiva sulle risposte respinte. Nel ragionamento matematico, FlowBalance migliora le prestazioni medie rispetto a FlowRL sia su Qwen3-4B sia su Qwen3-8B, migliorando anche la velocità e la stabilità dell’addestramento, evitando il collasso della lunghezza delle risposte dell’OPSD diretto e mostrando una maggiore diversità di strategie corrette in un test diagnostico controllato su AIME24.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv