Vai al contenuto
AI.info

Ricerca

Verso modelli ricorrenti fatti bene, parte II: ripensare in corrispondenza dei punti fissi

Ogni ricorrenza di un modello linguistico ricorrente comporta costi aggiuntivi nell’addestramento, nella decodifica, nel prefill e nell’apprendimento per rinforzo (RL). Quanto più gli stati ricorrenti

Verso modelli ricorrenti fatti bene, parte II: ripensare in corrispondenza dei punti fissi
arXiv
2610.06833
Pubblicato
2026-10-05
Autori
Benhao Huang, Chufan Shi, Junlin Chen, Shicheng Wen, Zhengzhong Liu, Eric Xing, Xuezhe Ma

Abstract degli autori

Ogni ricorrenza di un modello linguistico ricorrente comporta costi aggiuntivi nell’addestramento, nella decodifica, nel prefill e nell’apprendimento per rinforzo (RL). Quanto più gli stati ricorrenti si avvicinano ai punti fissi, tanto meno conta il percorso seguito per raggiungerli. Questo consente di usare la retropropagazione troncata nell’addestramento, di condividere i valori chiave-valore (KV) terminali nella decodifica quasi senza perdita di accuratezza, di ottenere un modello studente distillato che esegue il prefill fino a 1,79 volte più velocemente e di effettuare aggiornamenti RL che calcolano i gradienti dagli stati salvati del rollout, 2 volte più velocemente rispetto alla retropropagazione lungo la traiettoria riprodotta. Miglioriamo quindi le due componenti dell’addestramento che plasmano questi punti fissi: la distribuzione a priori della profondità e l’iniezione dell’input. L’addestramento a profondità fissa impedisce la condivisione dei KV, mentre l’ampia distribuzione a priori della profondità di Huginn la consente, ma diluisce la supervisione alla profondità obiettivo più di quanto sia necessario per la condivisione. Apprendiamo la distribuzione a priori dal feedback sulle predizioni, con un termine di entropia che la mantiene ampia. Gli schemi di iniezione esistenti permettono alla componente dello stato nella direzione dell’input di amplificare o annullare l’iniezione; con l’iniezione ortogonale eliminiamo questa componente. Da 100 milioni a 1,6 miliardi di parametri, la distribuzione a priori appresa e l’iniezione ortogonale riducono la perplessità a ogni scala rispetto, rispettivamente, alla distribuzione a priori di Huginn e agli schemi di iniezione esistenti. Con 1,6 miliardi di parametri, la distribuzione a priori appresa, con una cache KV 3 volte più piccola, eguaglia la media downstream dell’addestramento a profondità fissa con la cache completa.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv