Vai al contenuto
AI.info

Ricerca

Modelli di ricompensa a diffusione

I modelli di ricompensa sono alla base dell’allineamento dei grandi modelli linguistici, ma gli approcci prevalenti riducono ogni coppia prompt-risposta a una stima puntuale o a una distribuzione appa

Modelli di ricompensa a diffusione
arXiv
2609.33803
Pubblicato
2026-09-27
Autori
Xiangyang Wang, Bingxiang He, Zeyuan Liu, Jiaze WangZiqing Qiao, Yuxin Zuo, Huan-ang Gao, Cheng Qian, Wenbin Zhang, Ran Li, Youbang Sun, Ning Ding, Yuanchun Shi, Zhiyuan Liu, Chaojun Xiao, Chun Yu

Abstract degli autori

I modelli di ricompensa sono alla base dell’allineamento dei grandi modelli linguistici, ma gli approcci prevalenti riducono ogni coppia prompt-risposta a una stima puntuale o a una distribuzione appartenente a una famiglia parametrica fissa. Questo contrasta con le preferenze umane, che sono intrinsecamente multimodali: una stessa risposta può essere ragionevolmente valutata in molti modi e nessuna singola famiglia li comprende tutti. Per rappresentare meglio questa struttura, introduciamo DRM, un Diffusion Reward Model che riformula la modellazione della ricompensa come stima della densità condizionata $p(\mathbf{r}\mid x,y)$. Condizionato da un encoder LLM con parametri congelati, un Diffusion Transformer leggero trasforma il rumore gaussiano in un vettore di ricompense attraverso un processo di denoising, senza imporre ipotesi parametriche sulla distribuzione in uscita e rappresentandone naturalmente la struttura multimodale. Un’unica architettura gestisce sia dati di regressione multiattributo sia dati di preferenza a coppie; in fase di inferenza, $N$ campioni formano una distribuzione empirica delle ricompense da cui si possono ricavare uno scalare, una varianza o dei quantili. Su cinque benchmark, DRM eguaglia o supera i modelli di riferimento a parità di dati e backbone, resta competitivo rispetto a RM discriminativi, distribuzionali e generativi molto più grandi nonostante la modesta scala del suo addestramento, e recupera la struttura multimodale delle ricompense laddove le teste convenzionali la riducono a un punto. Il rifiuto che tiene conto dell’incertezza e l’aggregazione basata sul limite inferiore di confidenza (LCB) dimostrano inoltre che DRM può sfruttare informazioni sulla distribuzione che vanno oltre una ricompensa scalare per migliorare le decisioni del modello di ricompensa. Ulteriori esperimenti di RLHF a valle mostrano che usare DRM come modello di ricompensa durante l’addestramento migliora le prestazioni della policy, confermando direttamente il vantaggio pratico della modellazione della ricompensa basata sulla diffusione per l’addestramento RLHF.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv