Ricerca
Cache KV in fase di elaborazione con ancore pulite per accelerare la diffusione video autoregressiva
La diffusione video autoregressiva in pochi passaggi genera un video lungo suddividendolo in segmenti temporali, prodotti uno dopo l’altro attraverso una breve sequenza di fasi di denoising. Per conse

- arXiv
- 2609.32540
- Pubblicato
- 2026-09-26
- Autori
- Yikai Wang, Xiao Han, Mengmeng Xu, Juan Camilo Perez, Yiannis Douratsos, Sen He, Zijian Zhou, Fei Zhang, Zhaochong An, Juan-Manuel Perez-Rua, Chen Change Loy, Tao Xiang
Abstract degli autori
La diffusione video autoregressiva in pochi passaggi genera un video lungo suddividendolo in segmenti temporali, prodotti uno dopo l’altro attraverso una breve sequenza di fasi di denoising. Per conservare in memoria i segmenti già generati, i metodi precedenti ricostruiscono una cache chiave–valore (KV) pulita o meno rumorosa mediante passaggi forward aggiuntivi, costruendo così la cache senza far avanzare un latente di output. Tuttavia, ogni passaggio forward di denoising calcola già la cache KV in fase di elaborazione del segmento corrente. Presentiamo FlashForward, che riutilizza direttamente questa cache ed evita i costosi passaggi forward del modello dedicati esclusivamente all’aggiornamento della cache. Quando il segmento corrente completa una fase di denoising, la cache specifica di quella fase è già disponibile per il segmento successivo. Assegnando una GPU a ciascuna fase, segmenti diversi possono quindi trovarsi contemporaneamente in fasi diverse. Questa disponibilità anticipata ha un costo in termini di qualità: lo storico risultante, abbinato alla fase, è rumoroso e provoca una deriva nell’aspetto e nel movimento tra i segmenti. Per integrarlo, FlashForward produce latenti ausiliari sparsi di ancoraggio puliti prima che venga generata la regione corrispondente, così da stabilizzare le traiettorie di generazione mediante questo condizionamento da entrambi i lati. Le due memorie operano su scale temporali diverse: la cache KV sparsa delle ancore pulite fornisce una guida strutturale grossolana, a lungo raggio e da entrambi i lati, mentre lo storico denso abbinato alla fase preserva l’evoluzione fine e recente. Con un massimo di quattro GPU, FlashForward è $1.16$--$1.69\times$ più veloce di HiAR e $1.42$--$2.92\times$ più veloce di Self-Forcing per video a 16 FPS di 20 secondi o più, con backbone di scala 1,3B e 14B a 480p e 720p. Su VBench, per il modello 1,3B a 480p, ottiene punteggi più alti e rimane stabile a durate maggiori, dimostrando che FlashForward genera video di alta qualità e temporalmente coerenti per durate di 20s, 35s e 65s a una velocità di generazione molto superiore.