Ricerca
Esplorare ampiamente, ragionare con precisione: spingere i piccoli modelli verso la frontiera grazie al campionamento
Il campionamento con accentuazione mediante potenza è un’alternativa, in fase di inferenza, al post-addestramento tramite apprendimento per rinforzo (RL) per migliorare il ragionamento dei grandi mode

- arXiv
- 2609.38104
- Pubblicato
- 2026-09-29
- Autori
- Panagiotis Theodoropoulos, Nan Jiang, Xintong Duan, Ali Hasan, Yuriy Nevmyvaka, Evangelos A. Theodorou, Wei Deng
Abstract degli autori
Il campionamento con accentuazione mediante potenza è un’alternativa, in fase di inferenza, al post-addestramento tramite apprendimento per rinforzo (RL) per migliorare il ragionamento dei grandi modelli linguistici (LLM). Amplifica le sequenze ad alta probabilità secondo il modello di base senza aggiornare i parametri né ricorrere a ricompense esterne, evitando la costosa ottimizzazione e la generalizzazione irregolare dell’RL. Questo approccio, tuttavia, presenta un compromesso fondamentale tra esplorazione e sfruttamento: % un’accentuazione forte limita l’esplorazione, intrappolando i campionatori in percorsi di ragionamento plausibili ma errati, mentre un’accentuazione debole lascia troppo diffusa la distribuzione delle risposte. Per superare questo compromesso, introduciamo \textbf{Parallel Power Tempering (PPT)}, che realizza il campionamento degli LLM con accentuazione mediante potenza attraverso il tempering parallelo. L’esecuzione in parallelo di più repliche \emph{interacting} a diversi livelli di accentuazione consente alle repliche a potenza inferiore di esplorare percorsi di ragionamento diversi e alle catene a potenza superiore di sfruttare ulteriormente le risposte a maggiore probabilità favorite dalla distribuzione bersaglio accentuata. In particolare, adattiamo \method{} al campionamento in fase di inferenza attenuando una distorsione dovuta al troncamento, individuata nei precedenti campionatori basati sulla potenza, ed esaminiamo strategie efficaci di scambio entro limiti di memoria e capacità di calcolo. Un’ampia sperimentazione mostra che \method{} migliora sostanzialmente il campionamento con accentuazione mediante potenza a catena singola e supera i modelli sottoposti a post-addestramento tramite RL, producendo percorsi di ragionamento di qualità superiore e raggiungendo persino prestazioni paragonabili a quelle dei modelli di frontiera.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv