Ricerca
Attenzione lineare triadica: stati ricorrenti tridimensionali per la modellazione di sequenze a contesto lungo
Le reti neurali ricorrenti (RNN) comprimono il contesto precedente in uno stato di memoria di dimensione fissa, consentendo così un’inferenza a tempo costante. La dimensione dello stato di memoria è u

- arXiv
- 2609.36529
- Pubblicato
- 2026-09-29
- Autori
- Oliver Sieberling, Bharat Runwal, David Jin, Ryan Chin, Rameswar Panda, Yoon Kim
Abstract degli autori
Le reti neurali ricorrenti (RNN) comprimono il contesto precedente in uno stato di memoria di dimensione fissa, consentendo così un’inferenza a tempo costante. La dimensione dello stato di memoria è un fattore cruciale per le loro prestazioni, come mostra il forte rendimento e la rinnovata diffusione dell’attenzione lineare, che estende gli stati nascosti vettoriali delle RNN ordinarie a stati nascosti matriciali. Un aspetto cruciale è che l’attenzione lineare lo fa usando i parametri in modo efficiente, in particolare scrivendo nello stato nascosto matriciale il prodotto esterno dei vettori di chiave e valore. Generalizziamo questa costruzione e proponiamo l’attenzione lineare triadica, che scrive il prodotto esterno triadico di una chiave, una seconda chiave e un valore in uno stato tensoriale del terzo ordine (ossia tridimensionale) e lo legge contraendo entrambi gli assi delle chiavi con due query. Una seconda chiave di dimensione $E$ aumenta quindi di $E$ volte la dimensione dello stato, aggiungendo soltanto due proiezioni. L’attenzione lineare triadica è compatibile con l’oblio dipendente dai dati, la regola delta e l’addestramento parallelo per blocchi. Applicata a Gated DeltaNet e all’attenzione lineare con gating scalare, migliora notevolmente la modellazione del linguaggio a contesto lungo e la capacità di richiamo, superando le alternative che ampliano lo stato.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv