Vai al contenuto
AI.info

Ricerca

Esplorare ampiamente, ragionare con precisione: spingere i piccoli modelli verso la frontiera grazie al campionamento

Il campionamento con accentuazione mediante potenza è un’alternativa, in fase di inferenza, al post-addestramento tramite apprendimento per rinforzo (RL) per migliorare il ragionamento dei grandi mode

Esplorare ampiamente, ragionare con precisione: spingere i piccoli modelli verso la frontiera grazie al campionamento
arXiv
2609.38104
Pubblicato
2026-09-29
Autori
Panagiotis Theodoropoulos, Nan Jiang, Xintong Duan, Ali Hasan, Yuriy Nevmyvaka, Evangelos A. Theodorou, Wei Deng

Abstract degli autori

Il campionamento con accentuazione mediante potenza è un’alternativa, in fase di inferenza, al post-addestramento tramite apprendimento per rinforzo (RL) per migliorare il ragionamento dei grandi modelli linguistici (LLM). Amplifica le sequenze ad alta probabilità secondo il modello di base senza aggiornare i parametri né ricorrere a ricompense esterne, evitando la costosa ottimizzazione e la generalizzazione irregolare dell’RL. Questo approccio, tuttavia, presenta un compromesso fondamentale tra esplorazione e sfruttamento: % un’accentuazione forte limita l’esplorazione, intrappolando i campionatori in percorsi di ragionamento plausibili ma errati, mentre un’accentuazione debole lascia troppo diffusa la distribuzione delle risposte. Per superare questo compromesso, introduciamo \textbf{Parallel Power Tempering (PPT)}, che realizza il campionamento degli LLM con accentuazione mediante potenza attraverso il tempering parallelo. L’esecuzione in parallelo di più repliche \emph{interacting} a diversi livelli di accentuazione consente alle repliche a potenza inferiore di esplorare percorsi di ragionamento diversi e alle catene a potenza superiore di sfruttare ulteriormente le risposte a maggiore probabilità favorite dalla distribuzione bersaglio accentuata. In particolare, adattiamo \method{} al campionamento in fase di inferenza attenuando una distorsione dovuta al troncamento, individuata nei precedenti campionatori basati sulla potenza, ed esaminiamo strategie efficaci di scambio entro limiti di memoria e capacità di calcolo. Un’ampia sperimentazione mostra che \method{} migliora sostanzialmente il campionamento con accentuazione mediante potenza a catena singola e supera i modelli sottoposti a post-addestramento tramite RL, producendo percorsi di ragionamento di qualità superiore e raggiungendo persino prestazioni paragonabili a quelle dei modelli di frontiera.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv