Ricerca
Apprendimento con supporto locale
Esploriamo il problema dell’oblio catastrofico nei grandi modelli preaddestrati. Considerando l’oblio come un problema geometrico nello spazio degli input di ciascuna matrice dei pesi, individuiamo un

- arXiv
- 2610.02126
- Pubblicato
- 2026-10-01
- Autori
- Assaf Ben-Kish, Akarsh Kumar, James Glass, Raja Giryes
Abstract degli autori
Esploriamo il problema dell’oblio catastrofico nei grandi modelli preaddestrati. Considerando l’oblio come un problema geometrico nello spazio degli input di ciascuna matrice dei pesi, individuiamo un obiettivo naturale di conservazione rispetto al quale gli aggiornamenti prodotti dagli ottimizzatori basati sul gradiente sono subottimali. Su questa base proponiamo Local Support Learning (LSL), un framework di uso generale che integra l’addestramento basato sul gradiente per conservare le capacità precedenti senza accedere ai dati precedenti. Durante una nuova fase di apprendimento, LSL combina due componenti con ruoli distinti: un adattatore dei pesi standard, addestrato come di consueto a minimizzare la funzione di perdita, e una funzione di gating che attiva l’adattatore solo per le attivazioni in ingresso provenienti dalla sua distribuzione di addestramento, circoscrivendo l’aggiornamento a quella distribuzione. La difficoltà principale è che questa funzione deve instradare i dati di tutte le fasi di apprendimento pur essendo addestrata soltanto sui dati della fase corrente. La affrontiamo con una funzione di gating basata su un modello di miscela gaussiana (GMM), la cui verosimiglianza diminuisce rapidamente allontanandosi dai dati di addestramento: ha quindi una tendenza naturale a rimanere inattiva sui dati delle fasi precedenti. Mostriamo che questo approccio di post-training può risolvere il problema dell’oblio in LLM fino a 7 miliardi di parametri, conservando sia le capacità preaddestrate sia quelle affinate tramite fine-tuning attraverso più fasi di addestramento, con un uso efficiente della memoria e delle risorse di calcolo, robustezza rispetto alla scelta degli iperparametri e potenziale di scalabilità.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv