Vai al contenuto
AI.info

Ricerca

Video DeltaNet: un’attenzione ibrida nativa per la generazione di video in diretta streaming

Durante il denoising, i modelli di diffusione video elaborano ripetutamente lunghe sequenze di token spaziotemporali, e l’attenzione diventa così un importante collo di bottiglia computazionale. L’att

Video DeltaNet: un’attenzione ibrida nativa per la generazione di video in diretta streaming
arXiv
2609.20744
Pubblicato
2026-09-17
Autori
Haocheng Xi, Yiming Xie, Hexu Zhao, Yiwen Zhang, Michael Liu, Thomas Creavin, Kurt Keutzer, Xiuyu Li, Zhaoyang Lv, Chenfeng Xu, Haiwen Feng

Abstract degli autori

Durante il denoising, i modelli di diffusione video elaborano ripetutamente lunghe sequenze di token spaziotemporali, e l’attenzione diventa così un importante collo di bottiglia computazionale. L’attenzione lineare offre un’alternativa interessante ed è stata ampiamente adottata nei recenti modelli linguistici di grandi dimensioni, ma applicarla direttamente ai modelli video spesso non consente di preservare le interazioni a grana fine necessarie per una generazione di alta qualità. Presentiamo Video DeltaNet (VDN), che combina l’attenzione Softmax locale con una memoria lineare bidirezionale per il contesto video a lungo raggio. Il suo ramo lineare introduce Video Delta Attention (VDA), che aggiorna la memoria una volta per fotogramma incorporando congiuntamente i token spaziali del fotogramma. Proiezioni di output separate e gate apprendibili calibrano i due rami, mentre una procedura di allineamento al modello teacher articolata in fasi introduce progressivamente il nuovo percorso nei modelli preaddestrati. Implementiamo VDN su MiniMax H3, applicando l’architettura ibrida alle interazioni tra video e mantenendo Softmax per le interazioni che coinvolgono testo o audio. Con una distillazione a otto passaggi e uno stack di serving SGLang ottimizzato, VDN-H3 completa il denoising DiT di un video a 768p di 14,3 secondi in 6,70 secondi su otto GPU NVIDIA B200: un’accelerazione di 14,5 volte rispetto alla baseline H3 densa a 50 passaggi, con lo stesso numero di GPU.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv