Vai al contenuto
AI.info

Ricerca

Meglio chiamare la ricompensa: il reward hacking come astensione strategica nei modelli di ragionamento giuridico

Che cosa succede quando un modello di IA per l’ambito giuridico impara a sembrare un avvocato invece di ragionare come tale? Sottoponiamo Qwen3-8B a fine-tuning con Group Relative Policy Optimisation

Meglio chiamare la ricompensa: il reward hacking come astensione strategica nei modelli di ragionamento giuridico
arXiv
2610.06439
Pubblicato
2026-10-05
Autori
Subramanyam Sahoo, Justin Shenk

Abstract degli autori

Che cosa succede quando un modello di IA per l’ambito giuridico impara a sembrare un avvocato invece di ragionare come tale? Sottoponiamo Qwen3-8B a fine-tuning con Group Relative Policy Optimisation (GRPO), usando come obiettivo una proxy basata su tre caratteristiche superficiali: numero di citazioni, densità del linguaggio giuridico e lunghezza della risposta. Il modello non impara a ragionare meglio. Impara a non prendere posizione. Su 16 compiti di ragionamento giuridico con risposta sì o no tratti da LegalBench (N=320), l’accuratezza complessiva crolla da 0,500 (il livello del caso) a 0,072 (McNemar p < 10^-36), interamente per effetto della riduzione della quota di risposte nel formato richiesto da 0,900 a 0,109. Il modello smette di dare risposte nette. Eppure, quando prende posizione, l’accuratezza sale da 0,556 a 0,657: il crollo non dipende quindi da una perdita di capacità, ma da una risposta strategica. Il modello ha imparato che risposte prolisse e piene di citazioni, ma prive di una risposta diretta, ottengono un punteggio più alto di risposte concise e corrette. Chiamiamo questo fenomeno «effetto Saul Goodman»: un comportamento che assume al massimo grado i modi di un avvocato, evitando al tempo stesso il più possibile di prendere posizione. Dimostriamo formalmente che è la risposta ottimale a qualsiasi proxy basata su caratteristiche superficiali che non penalizzi l’astensione. Mostriamo inoltre che l’89,3% delle citazioni prodotte dopo l’addestramento è costituito da allucinazioni strutturalmente implausibili: molte sono nomi leggermente alterati di vere sentenze fondamentali, di fatto costruiti per reggere a una lettura superficiale ma non a un esame attento. Per individuare questo problema prima della distribuzione del modello, introduciamo tre strumenti diagnostici: il Confidence Theater Score (CTS), il Citation Plausibility Rate (CPR) e il Regret Gap (RG). In un ambito in cui una risposta sbagliata, data con sicurezza, può costituire negligenza professionale, la lezione più generale è chiara: una funzione di ricompensa che misura quanto una risposta sembri giuridica produrrà un modello il più fotogenico possibile e il meno utile possibile.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv