Ricerca
Pianificazione del ragionamento ricorsivo nei transformer con cicli
I modelli di ragionamento ricorrenti suscitano un interesse crescente come mezzo per aumentare il calcolo al momento dell’inferenza, in genere perfezionando iterativamente gli stati latenti con parame

- arXiv
- 2609.36653
- Pubblicato
- 2026-09-29
- Autori
- Boyuan Wang, Chengyao Yu, Jiaxi Ren, Hongxin Wei, Bingyi Jing, Yuxin Tao
Abstract degli autori
I modelli di ragionamento ricorrenti suscitano un interesse crescente come mezzo per aumentare il calcolo al momento dell’inferenza, in genere perfezionando iterativamente gli stati latenti con parametri condivisi. Questi modelli, però, applicano ogni aggiornamento appreso con una scala unitaria fissa: una scelta che può essere troppo prudente quando gli aggiornamenti producono progressi persistenti e troppo aggressiva quando oscillano, limitando i benefici dei cicli aggiuntivi. Per capire come la scala debba variare lungo la traiettoria, analizziamo anzitutto la sensibilità della loss finale alla scala degli aggiornamenti ricorrenti. Mostriamo che la sua media nel tempo può essere scomposta esattamente nei contributi del progresso persistente e delle fluttuazioni centrate. Su questa base introduciamo il Trajectory Adaptive Progress-Fluctuation Scheduler (TAPS), che monitora l’equilibrio tra i due contributi nel corso degli aggiornamenti ricorrenti e adatta online la dimensione del passo. Sul piano teorico, stabiliamo condizioni sufficienti affinché TAPS riduca la loss finale attesa e raggiunga una qualità obiettivo con meno cicli ricorrenti. Sul piano empirico, mostriamo che TAPS migliora l’accuratezza finale in diversi compiti di ragionamento strutturato senza riaddestramento. Incorporando inoltre il principio del progresso e delle fluttuazioni nell’addestramento, TAPS produce ulteriori miglioramenti dell’accuratezza, con un’accelerazione fino a 1,56 volte in termini di tempo effettivo, a parità di accuratezza rispetto al modello di riferimento. L’efficacia di TAPS con diverse architetture ricorrenti e strategie di inferenza ne conferma l’ampia applicabilità. Nel loro insieme, questi risultati mostrano che la scala degli aggiornamenti è un asse di controllo complementare dell’inferenza ricorrente, accanto all’architettura e alla profondità.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv