Vai al contenuto
AI.info

Ricerca

Ampliare il ragionamento degli LLM

Di solito, la capacità di calcolo aggiuntiva in fase di inferenza viene impiegata per campionare più catene di ragionamento. Studiamo invece da quale punto, all’interno di una catena esistente, conven

Ampliare il ragionamento degli LLM
arXiv
2610.05584
Pubblicato
2026-10-04
Autori
Rian Atri, Evan Luo

Abstract degli autori

Di solito, la capacità di calcolo aggiuntiva in fase di inferenza viene impiegata per campionare più catene di ragionamento. Studiamo invece da quale punto, all’interno di una catena esistente, convenga avviare una continuazione aggiuntiva. Definiamo l’utilità dell’espansione come la variazione della correttezza ottenuta riavviando una catena da un passaggio memorizzato e la misuriamo in ogni passaggio idoneo per nove modelli su sei benchmark (41 combinazioni modello-benchmark). La posizione del riavvio conta: nelle verifiche su dati separati relative a 5, 16 e 38 combinazioni, i passaggi selezionati sulla base di un insieme di continuazioni ottengono risultati migliori di una distribuzione uniforme dei riavvii quando vengono valutati su continuazioni distinte (+4,25 punti [+2,51, +6,63] in una nuova verifica su cinque combinazioni). Una regola fissa che riavvia la catena dagli ultimi passaggi idonei, always-last, costituisce un solido termine di confronto: il nostro router addestrato supera la distribuzione uniforme dei riavvii, ma non mostra un miglioramento rilevato rispetto a questa regola. Su DeepSeek-R1-Distill-Qwen-14B/MATH-500, always-last supera la frontiera esatta della self-consistency di +0,052 [+0,008, +0,098] a parità di output generato complessivo, usando 0,774 volte l’output generato complessivo della self-consistency con quattro campioni. La selezione tramite oracolo con cross-fitting individua ancora, nella valutazione su dati separati, un margine di miglioramento oltre le classi posizionali dichiarate: un obiettivo per i futuri selettori. Infine, risolvere le parità tra le etichette dei passaggi scegliendo l’indice più basso inverte il segno del vantaggio di un selettore puntuale rispetto alla distribuzione uniforme dei riavvii in ciascuno dei cinque seed di un test diagnostico con quattro rollout per passaggio; risolvere le parità in modo casuale elimina questa distorsione.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv