Ricerca
Che cosa rende efficace la ricorrenza nei modelli linguistici a ciclo?
I modelli linguistici a ciclo (LoopLMs) aumentano la profondità computazionale condividendo i parametri, offrendo un modo per aumentare il calcolo in fase di inferenza senza aggiungere parametri. Rest

- arXiv
- 2609.36636
- Pubblicato
- 2026-09-29
- Autori
- Xinlin Zhuang, Siyuan Wang, Imran Razzak, Weiyang Liu
Abstract degli autori
I modelli linguistici a ciclo (LoopLMs) aumentano la profondità computazionale condividendo i parametri, offrendo un modo per aumentare il calcolo in fase di inferenza senza aggiungere parametri. Resta però da chiarire quando una maggiore ricorrenza sia vantaggiosa e in che modo le scelte architetturali ne influenzino l’efficacia. Attraverso esperimenti controllati, esaminiamo sistematicamente (1) quando la ricorrenza è utile, (2) dove applicarla e (3) come il suo condizionamento influisce sulle prestazioni. La nostra valutazione comprende budget di inferenza inferiori, interni e superiori all’orizzonte di addestramento, su compiti di conoscenza e ragionamento. (1) Riscontriamo che la ricorrenza può migliorare il ragionamento oltre l’orizzonte di addestramento, pur peggiorando le prestazioni nei compiti di conoscenza, ma i problemi di ragionamento più difficili non ne traggono sistematicamente un beneficio maggiore. (2) Le prestazioni dipendono anche da come vengono distribuiti i livelli distinti e le iterazioni ricorrenti: la sola profondità effettiva non basta quindi a prevedere il comportamento. I livelli di output non ricorrenti migliorano la robustezza quando si eseguono meno iterazioni, mentre la collocazione preferibile dei livelli di input e output varia in base al budget di inferenza. (3) Infine, riscontriamo che l’iniezione convenzionale dello stato iniziale offre una robustezza limitata al variare della profondità di ricorrenza. Proponiamo quindi come alternativa l’iniezione dello stato storico e mostriamo che, combinata con il condizionamento sul passo temporale, l’iniezione dello stato storico per canale offre una soluzione più efficace e a basso costo, che preserva meglio le conoscenze quando si eseguono più iterazioni e migliora la robustezza con budget di inferenza diversi. Nel complesso, i nostri risultati chiariscono quando il calcolo ricorrente è utile e dove non lo è, e offrono indicazioni pratiche per progettare LoopLMs che funzionino con budget di inferenza variabili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv