Ricerca
Imparare a risolvere problemi difficili con l’RL per gli LLM senza arrendersi mai
Dimostriamo che addestrare gli LLM con l’RL non migliora le prestazioni in egual misura su tutti i problemi di un dataset. L’RL produce grandi miglioramenti sui problemi facili, che un LLM sa già riso

- arXiv
- 2609.13443
- Pubblicato
- 2026-09-11
- Autori
- Michael Noukhovitch, Hamish Ivison, Nathan Lambert, Aaron Courville
Abstract degli autori
Dimostriamo che addestrare gli LLM con l’RL non migliora le prestazioni in egual misura su tutti i problemi di un dataset. L’RL produce grandi miglioramenti sui problemi facili, che un LLM sa già risolvere bene, ma miglioramenti modesti su quelli difficili. Chiamiamo questo fenomeno effetto Matteo nell’RL per gli LLM, dal fenomeno del vantaggio cumulativo studiato in economia e nella scienza delle reti, riassunto nell’espressione «i ricchi diventano sempre più ricchi». La spiegazione più immediata è che trovare la soluzione di un problema difficile richiede più risorse di calcolo. Sosteniamo che i moderni metodi di RL aggravino il problema sprecando troppe risorse di calcolo sui problemi facili e che dovrebbero invece riallocarle dinamicamente. Presentiamo Never Give Up (NGU), un semplice metodo di campionamento adattivo che continua a generare campioni per un problema finché non ne produce uno corretto. Sfruttando l’RL asincrono, il metodo usa naturalmente meno campioni per scartare i problemi facili e destina più risorse di calcolo alla soluzione di quelli difficili. Esaminiamo le scelte progettuali che influiscono su NGU, come la robustezza off-policy, e definiamo una serie di buone pratiche. Sul benchmark matematico Deepscaler, NGU migliora le prestazioni per unità di calcolo, soprattutto sui problemi più difficili. In Manufactoria, un recente compito di programmazione, il GRPO standard con una ricompensa per ciascun test non riesce a risolvere completamente i problemi che comprendono test facili e difficili. NGU migliora iterativamente, superando test sempre più difficili, finché non impara a risolvere completamente i problemi di programmazione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv