Vai al contenuto
AI.info

Ricerca

WorldAttention: un’architettura di attenzione efficiente per modelli interattivi del mondo basati su video

Sfruttando il paradigma della diffusione autoregressiva, i modelli interattivi del mondo basati su video e condizionati dal testo mirano a simulare ambienti coerenti nel tempo seguendo istruzioni test

WorldAttention: un’architettura di attenzione efficiente per modelli interattivi del mondo basati su video
arXiv
2609.34606
Pubblicato
2026-09-28
Autori
Zeyu Zhang, Jinyuan Mao, Dakai An, Wangbo Zhao, Hanfeng Lu, Jiasheng Tang, Yinghao Yu, Wei Wang, Bohan Zhuang

Abstract degli autori

Sfruttando il paradigma della diffusione autoregressiva, i modelli interattivi del mondo basati su video e condizionati dal testo mirano a simulare ambienti coerenti nel tempo seguendo istruzioni testuali. Rendere possibile una generazione a bassa latenza e di lunga durata è fondamentale per l’IA incarnata e la pianificazione basata su simulazioni, ma i framework attuali ricorrono soprattutto a meccanismi a finestra mobile per contenere la complessità computazionale. Questo approccio, però, sacrifica inevitabilmente il contesto storico, compromettendo le capacità di interazione a lungo termine. Mantenere una cache dell’intera cronologia, viceversa, comporta costi computazionali e un consumo di memoria proibitivi: la complessità quadratica dell’attenzione genera un carico computazionale eccessivo, mentre la crescita lineare della cache KV porta inevitabilmente a saturare la memoria della GPU. Per superare questi limiti, proponiamo WorldAttention, un’architettura di attenzione orientata ai sistemi che raggiunge un’elevata efficienza grazie alla progettazione congiunta di kernel di attenzione specializzati e di una gestione gerarchica della cache KV. Per prima cosa, introduciamo Hybrid Sparse Attention (HSA), che integra un’attenzione globale lineare con un’attenzione sparsa adattiva per ciascuna testa. Progettiamo inoltre una Hierarchical KV Cache (HKV), che organizza le coppie KV storiche in pagine indicizzate semanticamente su più livelli di memoria, consentendo un recupero granulare e un controllo della loro permanenza nella memoria della GPU. Entrambe le soluzioni sono supportate da kernel dedicati, che ne traducono efficacemente l’efficienza teorica in prestazioni effettive. Esperimenti approfonditi su VBench-Long e InterVBench dimostrano che WorldAttention supera sistematicamente i precedenti metodi allo stato dell’arte, ottenendo punteggi di coerenza del soggetto pari, rispettivamente, a 0,9472 su VBench-Long e 0,9668 su InterVBench.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv