Ricerca
GRACE: compressione latente orientata alla generazione per generare video in modo efficiente
Gli autoencoder video ad alta compressione permettono di accelerare i modelli di diffusione video, perché il Diffusion Transformer (DiT) opera su un numero molto inferiore di token. Addestrarli, però,

- arXiv
- 2610.10524
- Pubblicato
- 2026-10-07
- Autori
- Jiyoung Kim, Paul Hyunbin Cho, Jisu Nam, Donghoon Lee, Hyunsung Go, Yeonkyeong Lee, Hansaem Kim, Seungryong Kim
Abstract degli autori
Gli autoencoder video ad alta compressione permettono di accelerare i modelli di diffusione video, perché il Diffusion Transformer (DiT) opera su un numero molto inferiore di token. Addestrarli, però, è difficile: un rapporto di compressione più elevato peggiora la qualità della ricostruzione, e recuperarla richiede più canali, il che, come è noto, rallenta la convergenza del DiT. Inoltre, il latente compresso è diverso da quello su cui il DiT è stato addestrato: occorre quindi riaddestrare il DiT preaddestrato da zero oppure adattarlo con costi considerevoli. Comprimere l’autoencoder con cui il DiT è stato addestrato sembra preservare la compatibilità, ma ottimizzarlo soltanto per la ricostruzione allontana comunque il latente dalla distribuzione appresa dal DiT. Per affrontare il problema, proponiamo Generation-Aware Latent Compression for Efficient Video Generation (GRACE), un metodo in due fasi che comprime un autoencoder video preaddestrato mantenendolo compatibile con il DiT preaddestrato. In particolare, manteniamo un latente di base congelato proveniente dall’encoder preaddestrato e apprendiamo un latente residuo per le informazioni perse con una compressione più forte. Allineiamo inoltre il latente compresso a quello preaddestrato nello spazio delle caratteristiche del DiT congelato, così da ottimizzare l’autoencoder per la generazione. Adattiamo poi il DiT con un fine-tuning leggero e una rimozione asimmetrica del rumore, applicata al latente di base prima che a quello residuo. GRACE riduce di 8 volte il numero di token di Wan2.1-I2V-14B e di 11,1 volte la sua latenza a 480x832x81, eguagliando su VBench la qualità della generazione della pipeline preaddestrata prima della compressione.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv