Vai al contenuto
AI.info

Ricerca

HLA-WM: attenzione lineare ibrida per modelli del mondo video a lungo orizzonte

I modelli del mondo video a lungo orizzonte richiedono una memoria persistente per mantenere la coerenza delle scene nelle sequenze generate più estese. L’attenzione softmax conserva l’intera cronolog

HLA-WM: attenzione lineare ibrida per modelli del mondo video a lungo orizzonte
arXiv
2610.05739
Pubblicato
2026-10-05
Autori
Zhuokun Chen, Feng Chen, Xi Lin, Xiyu Wu, Jiahao He, Jianfei Cai, Bohan Zhuang

Abstract degli autori

I modelli del mondo video a lungo orizzonte richiedono una memoria persistente per mantenere la coerenza delle scene nelle sequenze generate più estese. L’attenzione softmax conserva l’intera cronologia della generazione in una cache KV che cresce nel tempo, mentre l’attenzione lineare ricorrente comprime la cronologia in stati di dimensione fissa, con un costo in termini di memoria notevolmente inferiore. Tuttavia, riscontriamo in Gated DeltaNet (GDN) una grave perdita di informazioni sul lungo periodo: le informazioni provenienti da scene lontane ma pertinenti vengono progressivamente attenuate dai successivi aggiornamenti dello stato. Per affrontare questo limite, proponiamo HLA-WM, un framework di attenzione lineare ibrida che non richiede addestramento e combina un recupero a grana grossa guidato dalla geometria con il calcolo a grana fine dello stato lineare ricorrente. HLA-WM sfrutta la struttura affine di GDN per conservare nella cache sintesi compatte delle transizioni per ciascun blocco, recuperare i blocchi storici pertinenti alla scena usando la geometria della telecamera e ricombinarli in stati ricorrenti specifici per ciascuna query. Sul benchmark SANA-WM-Bench da $60$ secondi, HLA-WM migliora, senza ulteriore addestramento, tutte e sei le metriche aggregate di coerenza nelle rivisitazioni e di controllo della telecamera del generatore autoregressivo di base, con un aumento del PSNR di $0.74$ dB e una riduzione dell’errore di rotazione del $28.5\%$. I miglioramenti permangono dopo l’affinamento successivo e si estendono a MBench-A, dove HLA-WM migliora sistematicamente tutte e tre le metriche di coerenza nelle rivisitazioni in tutti e quattro i sottoinsiemi e in tutte le modalità di inferenza valutate, su $547$ campioni. Con un contesto di $60$ secondi, HLA-WM riduce di $12\times$ la memoria occupata dagli stati storici rispetto a una cache KV completa, comportando una riduzione della capacità di elaborazione in inferenza non superiore al $1.6\%$. Questi risultati dimostrano che una memoria ricorrente ad accesso selettivo può migliorare il richiamo delle scene a lungo termine, preservando al contempo i vantaggi di efficienza di GDN. Pagina del progetto: https://caesarhhh.github.io/hla-wm/

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv