Ricerca
Successi inattesi, fallimenti ricorrenti: attribuzione del merito guidata dall’entropia per l’esplorazione nel ragionamento degli LLM
L’apprendimento per rinforzo con ricompense verificabili (RLVR) migliora la capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM) attraverso un feedback sull’esito complessivo. T

- arXiv
- 2609.33781
- Pubblicato
- 2026-09-27
- Autori
- Woongyeong Yeo, Minki Kang, Chanuk Lee, Sangwoo Park, Jinheon Baek, Sung Ju Hwang
Abstract degli autori
L’apprendimento per rinforzo con ricompense verificabili (RLVR) migliora la capacità di ragionamento dei modelli linguistici di grandi dimensioni (LLM) attraverso un feedback sull’esito complessivo. Tuttavia, gli approcci recenti a un’attribuzione del merito più granulare richiedono spesso modelli ausiliari, campionamenti aggiuntivi o informazioni privilegiate. L’entropia della policy offre un segnale facilmente disponibile, ma dare priorità ai passaggi incerti sia nel rinforzo sia nella penalizzazione concentra le penalità dove le risposte fallite conservano ancora alternative per recuperare, con il rischio di limitare le opportunità di esplorazione. Per affrontare questo problema, introduciamo Entropic Advantage Policy Optimization (EAPO), un metodo di attribuzione del merito guidato dall’entropia che tratta successi e fallimenti in modo asimmetrico. In particolare, partendo dall’osservazione che un successo ottenuto nell’incertezza è meno ripetibile, mentre i fallimenti compiuti con elevata sicurezza tendono a ripresentarsi, EAPO combina l’entropia normalizzata della policy con il segno del vantaggio della risposta per rafforzare i successi inattesi e correggere i fallimenti ricorrenti. Assegna un rinforzo maggiore alle decisioni ad alta entropia nelle risposte riuscite e penalità maggiori alle decisioni a bassa entropia nelle risposte fallite, attenuando al tempo stesso le penalità nei passaggi incerti per preservare le possibilità di recupero. Redistribuendo il vantaggio della risposta tra i token, EAPO ricava l’attribuzione del merito a livello di token direttamente dai segnali dei rollout esistenti, senza supervisione aggiuntiva. Convalidiamo EAPO su una serie di compiti di ragionamento, utilizzando sia backbone di base sia backbone orientati al ragionamento, e dimostriamo che ottiene le migliori prestazioni complessive. Mostriamo inoltre che EAPO favorisce un’esplorazione più efficace, ampliando la copertura dei problemi e generando risposte candidate più diversificate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv