Ricerca
ImpossibleRubrics: mettere alla prova le griglie di valutazione generate come segnali di ricompensa
Le griglie di valutazione generate dai modelli linguistici sono sempre più utilizzate come segnali di ricompensa nell’apprendimento per rinforzo basato su griglie di valutazione, nelle valutazioni in

- arXiv
- 2609.16816
- Pubblicato
- 2026-09-15
- Autori
- Bowen Qin, Yi Xie, Yesheng Liu, Xi Yang
Abstract degli autori
Le griglie di valutazione generate dai modelli linguistici sono sempre più utilizzate come segnali di ricompensa nell’apprendimento per rinforzo basato su griglie di valutazione, nelle valutazioni in cui un LLM funge da giudice e nella correzione automatica. Sono affidabili solo se premiano le risposte oneste più di quelle avversarie ottimizzate per sfruttarle. Eppure sappiamo ancora poco della loro robustezza di fronte a questa ottimizzazione. Ci concentriamo sul caso più difficile: i compiti impossibili, in cui il prompt spinge il modello verso una conclusione non supportata, mentre l’unica risposta onesta è riconoscere che il compito è impossibile. Presentiamo ImpossibleRubrics, un benchmark di 169 compiti impossibili distribuiti in sei categorie di impossibilità. A ciascun compito è associato un certificato verificabile dell’oracolo che specifica che cosa una risposta onesta può e non può affermare; il benchmark comprende inoltre 48 casi di controllo a cui è possibile rispondere. Anziché fornire griglie di valutazione fisse, ImpossibleRubrics mette a disposizione ambienti di compito e certificati, consentendo di generare successivamente le griglie e di verificare con test avversari se premiano risposte che violano i certificati. Nel sottoinsieme non distorto di 150 ambienti su 169, gli undici generatori vengono sfruttati dall’8 al 26% delle volte. In un sottoinsieme selezionato deliberatamente per metterli alla prova, anche il generatore più robusto tra quelli che abbiamo misurato viene sfruttato nel 36% dei casi, mentre una griglia fedele al certificato viene sfruttata nello 0% dei casi: misuriamo quindi un divario nella qualità delle griglie, non l’impossibilità dei compiti. Un risultato va contro l’intuizione. Un’unica griglia generica («sii deciso, penalizza le risposte esitanti»), usata senza modifiche per ogni compito, viene sfruttata nel 64% dei casi; sette degli undici generatori vengono sfruttati ancora più spesso, pur scrivendo una griglia su misura per ciascun compito. I criteri su misura sembrano indicare a un attaccante quale affermazione inventare. Il problema non è che le griglie siano vaghe: sono specifiche sulle cose sbagliate.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv