Ricerca
Piccoli modelli linguistici come giudici nell’apprendimento per rinforzo basato su rubriche di valutazione
L’apprendimento per rinforzo basato su rubriche di valutazione estende il RL oltre i compiti con risposte esatte o verificatori basati su regole, assegnando un punteggio alle risposte in base a criter

- arXiv
- 2608.30005
- Pubblicato
- 2026-08-30
- Autori
- Fengyu Xie, Yilun Zhao, Bingsen Chen, Arman Cohan, Chen Zhao
Abstract degli autori
L’apprendimento per rinforzo basato su rubriche di valutazione estende il RL oltre i compiti con risposte esatte o verificatori basati su regole, assegnando un punteggio alle risposte in base a criteri specifici per ciascuna istanza. Questo, però, rende costoso il calcolo della ricompensa: l’addestramento richiede valutazioni ripetute secondo la rubrica, spesso tramite API proprietarie o LLM generativi locali usati come giudici, con 7B parametri o più. Studiamo se modelli linguistici più piccoli possano fungere da giudici efficienti e affidabili basati su rubriche. Per rendere misurabile questa domanda, costruiamo PointRubric e RaR-Science-Static, due dataset di valutazione puntuale basata su rubriche, con criteri specifici per ciascuna istanza ed etichette che indicano, per ogni elemento, se il criterio è soddisfatto. Confrontiamo tre modi di ricavare dai modelli piccoli giudizi sui singoli criteri: verdetti Generative, margini di logprobabilità Yes/No e giudici Probe. Su entrambi i dataset, il giudice Probe Qwen3-1.7B ottiene la concordanza più alta sui singoli criteri tra questi metodi, superando i giudici Generative e Logprob. Usato come modello di ricompensa per GRPO, addestra una policy il cui punteggio secondo la rubrica RaR-Science passa da 0,232 a 0,643, rispetto a 0,594 per un giudice Generative da 8B usato come riferimento; quest’ultimo, però, richiede 10,7$\times$ più tempo per la valutazione della ricompensa. Gli esperimenti di trasferimento tra compiti e domini suggeriscono inoltre che i giudici Probe preservano la struttura della ricompensa a livello dei singoli criteri in contesti diversi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv