Ricerca
Apprendimento locale greedy per il preaddestramento dei modelli linguistici: divari e progettazione degli obiettivi
L’apprendimento locale greedy per blocchi suddivide una rete in blocchi isolati rispetto ai gradienti, addestrati mediante loss ausiliarie locali, eliminando il passaggio all’indietro tra i blocchi: l

- arXiv
- 2610.04867
- Pubblicato
- 2026-10-04
- Autori
- Jihwan Moon, Sheir A. Zaheer, Jinmyoung Lee, Gunhee Kim, Chan Y. Park
Abstract degli autori
L’apprendimento locale greedy per blocchi suddivide una rete in blocchi isolati rispetto ai gradienti, addestrati mediante loss ausiliarie locali, eliminando il passaggio all’indietro tra i blocchi: la comunicazione tra le fasi avviene solo in avanti e ogni blocco può eseguire autonomamente un passo del proprio ottimizzatore. Sono proprietà direttamente rilevanti per l’addestramento decentralizzato con parallelismo del modello. Nella classificazione delle immagini, l’apprendimento locale è competitivo rispetto alla retropropagazione end-to-end; nei Transformer di piccole dimensioni, è noto che offre un’accelerazione grazie al parallelismo a fronte di una loss minima peggiore. Non è stato misurato come si comporti questo divario di loss nel preaddestramento autoregressivo di modelli linguistici (LM) su scala più ampia, né quali configurazioni degli obiettivi ausiliari lo riducano. Presentiamo uno studio empirico con lo stesso budget di token per ciascuna configurazione, condotto su modelli da 125M e 400M parametri con $K \in \{1,2,4\}$ blocchi e budget ottimali secondo Chinchilla, distinguendo nella progettazione degli obiettivi ausiliari l’architettura della rete dall’obiettivo di addestramento. Osserviamo che: (i) il divario rispetto all’addestramento end-to-end più che raddoppia passando da $K=2$ a $K=4$, ma con $K=4$ si riduce passando da 125M a 400M; (ii) sostituire una rete ausiliaria MLP con una basata su Transformer è un intervento efficace sul versante della rete e colma il 22-41% del divario; (iii) un obiettivo ausiliario di predizione di più token (MTP) aiuta alla prima interfaccia tra blocchi, mentre aggiungerlo alle interfacce più profonde peggiora i risultati; limitarlo al primo blocco produce la migliore configurazione con $K=4$ ($+0.062$ contro $+0.075$ nat a 400M); e (iv) l’esecuzione per blocco in modalità di deployment riduce la memoria occupata dalle attivazioni fino a $2.2\times$. Presentiamo questi risultati come indicazione empiricamente fondata per lo sviluppo di un metodo, non come metodo definitivo: gli obiettivi locali dovrebbero esercitare selettivamente, alle interfacce tra blocchi, una pressione a predire i token futuri, evitando al tempo stesso scorciatoie che aggirano il contenuto predittivo.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv