Vai al contenuto
AI.info

Ricerca

LexReward: un framework per le ricompense dei modelli linguistici giuridici basato su una tassonomia

I modelli linguistici giuridici richiedono segnali di ricompensa che tengano conto non solo della correttezza delle risposte, ma anche della qualità delle risposte giuridiche nelle sue diverse dimensi

LexReward: un framework per le ricompense dei modelli linguistici giuridici basato su una tassonomia
arXiv
2609.39071
Pubblicato
2026-09-30
Autori
Yida Cai, Xin Dai, Bingxiang He, Huiyuan Xie, Yuxiao Ye, Zhenghao Liu, Yang Bai, Zhiyuan Liu

Abstract degli autori

I modelli linguistici giuridici richiedono segnali di ricompensa che tengano conto non solo della correttezza delle risposte, ma anche della qualità delle risposte giuridiche nelle sue diverse dimensioni. I metodi di ricompensa esistenti, tuttavia, si basano spesso su giudizi complessivi poco dettagliati, che offrono scarsa specificità rispetto al dominio e limitata interpretabilità. Presentiamo LexReward, un framework basato su una tassonomia per la modellazione delle ricompense in ambito giuridico. LexReward descrive la qualità delle risposte giuridiche lungo tre dimensioni complementari: Style, che riguarda la qualità lessicale e sintattica; Element, che valuta soggetti giuridici, fatti, leggi e decisioni; e Chain, che valuta l’ordine, la completezza, la correttezza e l’assenza di ridondanze nel ragionamento giuridico. Per ciascuna dimensione, sviluppiamo griglie che specificano criteri di valutazione e livelli di qualità. Le ricompense così ottenute sono usate per costruire dati di preferenza a coppie per Direct Preference Optimization (DPO) e per l’addestramento di modelli di ricompensa. Gli esperimenti mostrano che le ricompense basate su queste griglie distinguono in modo affidabile risposte giuridiche di diversa qualità e che l’addestramento con DPO sui dati di preferenza migliora le prestazioni in tutte e tre le dimensioni. Anche i modelli di ricompensa appresi, LexRM, consentono un’efficace ottimizzazione successiva: attraverso l’apprendimento per rinforzo, ogni modello di ricompensa specifico per una dimensione migliora le prestazioni della policy nella dimensione corrispondente, senza richiedere risposte di riferimento al momento del calcolo della ricompensa. Le analisi condotte per ciascuna dimensione confermano ulteriormente l’efficacia della tassonomia e della costruzione delle ricompense proposte.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv