Vai al contenuto
AI.info

Ricerca

Ricompense basate sulle rubriche secondo la teoria della risposta all’item

Molti compiti linguistici non hanno un’unica risposta verificabile automaticamente. Le rubriche forniscono criteri per valutare le risposte a questi compiti. Nell’apprendimento per rinforzo, i verdett

Ricompense basate sulle rubriche secondo la teoria della risposta all’item
arXiv
2609.35646
Pubblicato
2026-09-28
Autori
Milad Yazdani, Yaser Souri, Xiren Zhou, Pranit Chawla, Dena Shahriari, Subhojit Som, Xia Song

Abstract degli autori

Molti compiti linguistici non hanno un’unica risposta verificabile automaticamente. Le rubriche forniscono criteri per valutare le risposte a questi compiti. Nell’apprendimento per rinforzo, i verdetti che ne risultano devono essere combinati in una ricompensa scalare. Un approccio comune consiste nel sommare i punti assegnati ai criteri soddisfatti. Combinazioni diverse di verdetti possono quindi ricevere la stessa ricompensa, e i punti fissi indicano quanto debba pesare ciascun criterio, non quanto il suo verdetto distingua i rollout attuali. Oltre a questo problema di aggregazione, valutare l’intera rubrica richiede un numero crescente di richieste al valutatore all’aumentare dei criteri. Per affrontare questi limiti, Rubric Response Theory (RRT) misura la qualità e seleziona i criteri quando quelli della rubrica sono indicatori monotoni di un obiettivo comune. Anziché sommare i punti assegnati, RRT usa un modello di risposta all’item a due parametri, che considera la combinazione dei verdetti come evidenza della qualità scalare relativa alla rubrica. In questo modello, il suo punteggio di verosimiglianza massimizza il rapporto segnale-rumore locale per la qualità. La sua Response Parameter Network (RPN) analizza il prompt e il testo dei criteri per prevedere la difficoltà e il potere discriminante di ciascun criterio. Man mano che la distribuzione della policy cambia durante l’addestramento, RRT usa l’expectation maximization online per aggiornare la RPN in base ai verdetti sui rollout attuali. Con Qwen3.5-4B come policy, il punteggio macro di RRT sui criteri di Medical, Science, Rubrics as Rewards Science e RubricBench supera di 1,7 punti quello della group relative policy optimization (GRPO). Sui criteri difficili e molto difficili di Medical e Science, RRT guadagna da 2,8 a 5,6 punti rispetto a GRPO. Con metà del budget per i criteri, la selezione adattiva di Fisher con una RPN congelata mantiene il punteggio macro sui criteri dei quattro dataset entro 0,1 punti da quello di GRPO con valutazione completa. Questi risultati mostrano che RRT può ridurre le richieste al valutatore pur rimanendo competitiva rispetto a GRPO.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv