Vai al contenuto
AI.info

Ricerca

FlowBalance: auto-miglioramento fondato sul verificatore a partire dall’esperienza di ragionamento on-policy

Un modello di ragionamento può migliorare grazie alla propria esperienza on-policy, ma questo ciclo interno è fragile: i verificatori dell’esito finale forniscono una supervisione affidabile ma scarsa

FlowBalance: auto-miglioramento fondato sul verificatore a partire dall’esperienza di ragionamento on-policy
arXiv
2609.03241
Pubblicato
2026-09-03
Autori
Zixun Huang, Kishan Panaganti, Haitao Mi, Leowei Liang

Abstract degli autori

Un modello di ragionamento può migliorare grazie alla propria esperienza on-policy, ma questo ciclo interno è fragile: i verificatori dell’esito finale forniscono una supervisione affidabile ma scarsa, mentre le indicazioni dettagliate prodotte dallo stesso modello possono rafforzare una fiducia infondata o concentrare troppo l’apprendimento su un’unica modalità di soluzione. Presentiamo FlowBalance, un metodo di auto-miglioramento fondato sul verificatore che apprende una distribuzione normalizzata sulle risposte complete. Per ogni traiettoria on-policy, una versione congelata della stessa policy, usata durante l’addestramento, sfrutta un contesto privilegiato per produrre incrementi della log-probabilità a livello di token, poi aggregati in un punteggio di autoguida per l’intera traiettoria. FlowBalance calibra questo punteggio in base al vantaggio di gruppo derivato dal verificatore: le indicazioni vengono mantenute per le traiettorie con vantaggio positivo, invertite per quelle con vantaggio negativo e disattivate quando il gruppo di traiettorie generate non mostra alcuna preferenza tra gli esiti. L’energia risultante ripondera esponenzialmente una policy di riferimento, e il bilanciamento delle traiettorie profilato adatta la distribuzione obiettivo normalizzata usando una stima della log-partizione per ciascun gruppo di traiettorie generate. In questo modo, l’autoguida viene calibrata sugli esiti tramite il bilanciamento delle traiettorie, senza una funzione di perdita separata per l’imitazione a livello di token. La nostra analisi dimostra la conservazione dei contrasti all’interno dei gruppi, una caratterizzazione in termini di KL inversa a variazione minima, il controllo monotono della ricompensa obiettivo da parte del verificatore e una correzione esatta contro l’autoguida falsamente positiva sulle risposte respinte. Nel ragionamento matematico, FlowBalance migliora le prestazioni medie rispetto a FlowRL sia su Qwen3-4B sia su Qwen3-8B, migliorando anche la velocità e la stabilità dell’addestramento, evitando il collasso della lunghezza delle risposte dell’OPSD diretto e mostrando una maggiore diversità di strategie corrette in un test diagnostico controllato su AIME24.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv