Ricerca
Il tuo Transformer può tenere a mente due pensieri contemporaneamente: prove della sovrapposizione lineare negli LLM
Sebbene i grandi modelli linguistici (LLM) si basino su componenti altamente non lineari, in questo lavoro dimostriamo che presentano una linearità fondamentale: quando gli input provenienti da flussi

- arXiv
- 2609.29845
- Pubblicato
- 2026-09-24
- Autori
- Pavel Tikhonov, Anton Korznikov, Matvey Mikhalchuk, Nikita Dragunov, Temurbek Rahmatullaev, Polina Druzhinina, Anton Razzhigaev, Ivan Oseledets, Elena Tutubalina
Abstract degli autori
Sebbene i grandi modelli linguistici (LLM) si basino su componenti altamente non lineari, in questo lavoro dimostriamo che presentano una linearità fondamentale: quando gli input provenienti da flussi di testo distinti vengono combinati linearmente, il modello produce una sovrapposizione delle singole distribuzioni del token successivo. Chiamiamo questo fenomeno \textit{ipotesi di linearità della sovrapposizione}. Presentiamo prove del fatto che la sovrapposizione sia una proprietà intrinseca dell’architettura Transformer, anziché una conseguenza emergente dell’addestramento; osserviamo infatti che tende a diminuire con il progredire del pretraining. Dimostriamo tuttavia che la linearità può essere ripristinata in misura considerevole con un fine-tuning leggero, riducendo notevolmente la divergenza tra la distribuzione prevista del token successivo e la media delle singole distribuzioni del token successivo. Infine, introduciamo una procedura di decodifica guidata che separa gli output sovrapposti, consentendo di generare simultaneamente due continuazioni coerenti con un singolo passaggio in avanti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv