Ricerca
Selezionare tracce SFT con percorsi diversificati migliora la generalizzazione dopo il RL
Le soluzioni verificate non sono tutte ugualmente utili per preparare i modelli di ragionamento all’apprendimento per rinforzo (RL). Presentiamo uno studio approfondito della diversità dei percorsi, c

- arXiv
- 2609.33780
- Pubblicato
- 2026-09-27
- Autori
- Dylan Zhang, Mingyuan Wu, Jinning Li
Abstract degli autori
Le soluzioni verificate non sono tutte ugualmente utili per preparare i modelli di ragionamento all’apprendimento per rinforzo (RL). Presentiamo uno studio approfondito della diversità dei percorsi, cioè della variazione nelle sequenze dei passaggi di ragionamento presenti nei dati di fine-tuning supervisionato (SFT), e proponiamo un’impronta leggera basata su regole per selezionare i dati in base a tale diversità. A parità di insieme di dati e di budget, e usando le stesse procedure di addestramento e gli stessi checkpoint, selezionare percorsi diversificati anziché simili aumenta il numero di problemi risolti dopo il RL, sia nei rompicapi sia in matematica, anche per problemi più difficili di quelli incontrati in ciascuna delle due fasi di addestramento. Negli esperimenti sintetici, un SFT con percorsi diversificati migliora il pass@8 di OLMo3-7B di 16,9 punti in ambienti esclusi dall’SFT. In una configurazione in cui un unico modello genera tutte le soluzioni candidate, la selezione diversificata produce un aumento fino a 6,2 punti del pass@8 medio su 10 benchmark di matematica. Le analisi diagnostiche precedenti al RL suggeriscono il perché: nonostante un’accuratezza media leggermente inferiore, un SFT diversificato può produrre sia tentativi riusciti sia tentativi falliti per un maggior numero di prompt, offrendo al RL relativo al gruppo più prompt da cui ricavare un segnale di apprendimento. Su 3 corpora open source, il nostro selettore, che usa solo la CPU e non effettua chiamate ai modelli, supera alternative più costose in ogni confronto delle prestazioni medie dopo il RL. Questi risultati individuano nella diversità dei percorsi di ragionamento un criterio pratico per selezionare dati SFT che preparino meglio i modelli al RL.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv