Vai al contenuto
AI.info

Ricerca

Perché la guida deterministica basata su PRM rende meno nel ragionamento con diffusione discreta

I modelli linguistici a diffusione discreta (dLLM) rendono disponibile a ogni passaggio una soluzione sottoposta a denoising, facendo apparire la guida basata su un modello di ricompensa del processo

Perché la guida deterministica basata su PRM rende meno nel ragionamento con diffusione discreta
arXiv
2609.35472
Pubblicato
2026-09-28
Autori
Yan Zhan, Shaobo Liu, Zhijun Gao

Abstract degli autori

I modelli linguistici a diffusione discreta (dLLM) rendono disponibile a ogni passaggio una soluzione sottoposta a denoising, facendo apparire la guida basata su un modello di ricompensa del processo (PRM) come un modo per impiegare risorse di calcolo durante la fase di test. Mostriamo che, quando il denoising, la valutazione del PRM e quella del modello di ricompensa dell’esito (ORM) vengono conteggiati nello stesso budget di passaggi forward, la forma deterministica di questa guida ottiene risultati peggiori di un metodo di riferimento molto più semplice. I nostri PRM assegnano un punteggio agli stati intermedi del denoising e sono addestrati in base alla correttezza della risposta finale. Con Dream-v0-Instruct-7B e 8 candidati per ciascun problema di GSM8K, conservare a ogni passaggio di valutazione il candidato con il punteggio PRM più alto porta al 65,18%, mentre il campionamento indipendente seguito dal riordinamento dei candidati tramite un ORM addestrato per il compito raggiunge il 75,13%. Il divario sale a 12,69 punti percentuali (pp) con 32 candidati ed è di 9,85 pp su MATH e 12,16 pp su MBPP. Lo riconduciamo a due problemi distinti. Primo, la guida elimina candidati sulla base di un segnale debole: su GSM8K, la ROC-AUC del PRM scende da 0,77 a 0,54 all’aumentare della quota di mascheramento, un calo che persiste quando gli stati vengono rietichettati mediante nuovi rollout. Inoltre, l’eliminazione dei candidati riduce la massima accuratezza raggiungibile tra quelli disponibili dall’81,05% dei campioni indipendenti al 67,30%. Secondo, su GSM8K e MATH, il PRM valuta male le soluzioni finali: a parità di budget, un campionatore Monte Carlo sequenziale riporta quella soglia al 77,89%, ma la selezione tramite PRM ottiene il 65,48%, un risultato paragonabile alla guida deterministica; un PRM riaddestrato sugli stati finali, invece, eguaglia l’ORM sugli stessi candidati. MBPP distingue i due problemi: in questo caso il PRM raggiunge il 65,47% quando riordina programmi completati, alla pari con l’ORM, ma il 50,88% quando guida il denoising. I risultati indicano due obiettivi per la guida dei dLLM: mantenere in gioco le soluzioni parziali corrette nelle prime fasi del denoising e affidare la scelta finale a un verificatore addestrato sugli stati finali. Rendiamo disponibili il corpus degli stati di denoising con etichette relative all’esito e un toolkit di valutazione per confronti riproducibili a parità di risorse di calcolo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv