Vai al contenuto
AI.info

Ricerca

HLA: attenzione lineare ibrida espressiva tramite combinazione dinamica a livello di chunk

L’attenzione lineare consente una decodifica autoregressiva efficiente su contesti lunghi comprimendo la cronologia in stati ricorrenti, ma questa compressione può rendere difficile l’accesso selettiv

HLA: attenzione lineare ibrida espressiva tramite combinazione dinamica a livello di chunk
arXiv
2610.05842
Pubblicato
2026-10-05
Autori
Zhuokun Chen, Xi Lin, Xiyu Wu, Jiahao He, Jianfei Cai, Bohan Zhuang

Abstract degli autori

L’attenzione lineare consente una decodifica autoregressiva efficiente su contesti lunghi comprimendo la cronologia in stati ricorrenti, ma questa compressione può rendere difficile l’accesso selettivo a informazioni sparse e distanti. Le estensioni esistenti basate su chunk aumentano la capacità di memoria, ma i coefficienti appresi per combinare i chunk possono rimanere fissi rispetto al contenuto dell’input e quindi non adattare l’accesso alla cronologia a ogni query. Introduciamo \emph{Hybrid Linear Attention} (HLA), un meccanismo di attenzione a livello di chunk dipendente dalla query per Gated DeltaNet (GDN). HLA rappresenta ogni chunk completato come un’esatta transizione affine dello stato e calcola gate di instradamento dipendenti dal contenuto a partire da rappresentanti compatti ottenuti mediante aggregazione con autoattenzione. Ogni gate interpola tra la corrispondente transizione storica e la funzione identità, controllando sia la memoria additiva del chunk sia la sua trasformazione degli stati precedenti. La regolarizzazione del supporto effettivo favorisce inoltre un instradamento concentrato per l’inferenza su informazioni sparse. Valutiamo HLA sia nell’adattamento di modelli preaddestrati sia nell’addestramento da zero. Nei modelli Qwen3.5 da 0,8B a 9B, HLA migliora costantemente i risultati rispetto a GDN nativo e alla combinazione fissa dei chunk, con incrementi fino a 5,57 punti percentuali su LongBench-V2 e 3,97 punti su RULER. In un esperimento controllato con un modello da 1,3B addestrato da zero su 100B token con un contesto di 4K, HLA migliora anche le prestazioni su RULER per contesti da 4K a 32K, con incrementi che passano da 0,83 punti a 4K a 4,22 punti a 32K. Questi risultati dimostrano che la composizione della memoria ricorrente dipendente dalla query migliora la modellazione di contesti lunghi e rimane efficace oltre la lunghezza del contesto di addestramento, pur utilizzando rappresentazioni affini compatte per ciascun chunk. Pagina del progetto: https://caesarhhh.github.io/hla/

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv