Ricerca
L’evoluzione dell’attenzione nei grandi modelli linguistici: meccanismi, compromessi e tendenze emergenti
La self-attention offre ai grandi modelli linguistici un accesso granulare al contesto, dipendente dalla query, ma le interazioni dense tra token comportano un costo quadratico nella fase di prefill e

- arXiv
- 2609.39661
- Pubblicato
- 2026-09-30
- Autori
- Zhentao Tan, Jingyi Shen, Yanbo Li, Yao Liu, Yue Wu, Jieping Ye
Abstract degli autori
La self-attention offre ai grandi modelli linguistici un accesso granulare al contesto, dipendente dalla query, ma le interazioni dense tra token comportano un costo quadratico nella fase di prefill e una cache chiave-valore che cresce con la lunghezza del contesto. La ricerca spazia quindi dalla compressione della memoria esplicita all’accesso sparso, dalla costruzione di stati ricorrenti alle dinamiche strutturate dello stato e alla combinazione di meccanismi eterogenei. Questa rassegna analizza tali sviluppi come forme di memoria contestuale interna al modello. Proponiamo uno schema di analisi a cinque dimensioni — Rappresentazione della memoria, Aggiornamento della memoria, Accesso, Lettura e Integrazione — che descrive che cosa viene rappresentato, come cambia, che cosa può essere oggetto di una query, come viene letto e come i risultati della lettura formano gli output. Lo schema permette di confrontare filoni di ricerca che si sovrappongono senza imporre un unico modello computazionale. Ricostruiamo gli sviluppi a livello dei meccanismi e la loro adozione nelle architetture sulla base di 59 record relativi a release di 14 importanti famiglie di modelli e di 11 endpoint open-weight ad alte prestazioni. In primo luogo, i metodi basati sulla memoria esplicita e quelli basati su stati ricorrenti mantengono interfacce distinte, ma controllano sempre più spesso funzioni di memoria sovrapposte. In secondo luogo, le architetture eterogenee coordinano sempre più i meccanismi lungo la profondità della rete: la combinazione livello per livello distribuisce elaborazioni complementari della memoria tra gli stadi della rappresentazione, mentre il riutilizzo tra livelli porta avanti elementi selezionati della memoria e artefatti di instradamento. La profondità diventa così una dimensione lungo la quale la memoria contestuale viene costruita e gestita. In terzo luogo, questi sviluppi motivano un’ipotesi di instradamento multidimensionale della memoria con stato: la memoria persistente è organizzata secondo l’estensione temporale, la profondità della rete, il tipo di substrato e la granularità della rappresentazione, mentre Scrittura sparsa e Lettura sparsa, coordinate tra loro, determinano che cosa viene mantenuto e che cosa contribuisce a ciascuna query. Nel complesso, progettare architetture efficienti per le sequenze riguarda sempre più l’organizzazione, il ciclo di vita e l’uso selettivo della memoria contestuale, anziché un operatore di attenzione considerato isolatamente.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv