Ricerca
Cliff: apprendere le ricompense di processo dal primo errore
L’apprendimento per rinforzo con ricompense verificabili (RLVR) si è affermato come un approccio efficace per il post-addestramento dei modelli linguistici di grandi dimensioni (LLM), ma il ricorso a

- arXiv
- 2609.02817
- Pubblicato
- 2026-09-02
- Autori
- Peixuan Han, Runhui Wang, Ketan Ramaneti, Jie Hao, Gerald Friedland, Chris Kong
Abstract degli autori
L’apprendimento per rinforzo con ricompense verificabili (RLVR) si è affermato come un approccio efficace per il post-addestramento dei modelli linguistici di grandi dimensioni (LLM), ma il ricorso a ricompense basate su risultati complessivi offre indicazioni limitate sui passaggi intermedi del ragionamento. Gli approcci esistenti, come la modellazione delle ricompense di processo e la distillazione on-policy, introducono ulteriori vincoli: richiedono, per esempio, un modello di ricompensa specializzato oppure presuppongono che il modello insegnante e quello studente seguano schemi di ragionamento identici. Osserviamo però che, una volta commesso il primo errore in un processo di ragionamento, valutarne i passaggi successivi fornisce poche informazioni aggiuntive, perché questi sono già condizionati da un prefisso non valido. Proponiamo quindi Cliff, una strategia per modulare le ricompense che si serve di un LLM pronto all’uso come modello insegnante per individuare il primo errore in ciascun rollout. Il rollout viene così suddiviso in modo naturale in due parti: un prefisso corretto e un suffisso errato. Cliff traduce poi questa informazione in vantaggi a livello di token, assegnando vantaggi positivi al prefisso corretto e un feedback negativo ai token successivi. Esperimenti condotti in 12 scenari diversi mostrano che Cliff migliora costantemente le prestazioni di ragionamento, superando la distillazione on-policy del 15% e il GRPO standard del 7%, anche con modelli insegnanti dalle capacità modeste. Analizziamo inoltre il ruolo della «verità di riferimento» in Cliff e ne studiamo le dinamiche di addestramento. Questi risultati mostrano che Cliff è un approccio semplice, generale ed efficace per migliorare l’RLVR grazie a una supervisione più ricca e granulare.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv