Ricerca
ViRDM: domare il matching delle distribuzioni delle rappresentazioni per la generazione causale di video in pochi passaggi
La diffusione autoregressiva (AR) di video in pochi passaggi consente la generazione in streaming a bassa latenza, ma i metodi di post-addestramento esistenti si basano prevalentemente sulla distillaz

- arXiv
- 2609.28923
- Pubblicato
- 2026-09-24
- Autori
- Zichong Meng, Chongjian Ge, Chun-Hao P. Huang, Yang Zhou, Huaizu Jiang
Abstract degli autori
La diffusione autoregressiva (AR) di video in pochi passaggi consente la generazione in streaming a bassa latenza, ma i metodi di post-addestramento esistenti si basano prevalentemente sulla distillazione con matching delle distribuzioni (DMD), che richiede sia un grande modello insegnante preaddestrato sia un critico online per stimare le discrepanze tra distribuzioni attraverso gli score di diffusione. In questo lavoro ci chiediamo se sia possibile eliminare questa onerosa struttura di insegnante e critico, addestrando dopo il preaddestramento solo il generatore rispetto a una distribuzione obiettivo precalcolata. Ispirandoci al matching delle distribuzioni delle rappresentazioni (RDM) per la generazione di immagini in un solo passaggio, ne studiamo sistematicamente il trasferimento alla generazione causale di video in pochi passaggi e individuiamo tre ostacoli principali: un percorso del gradiente proibitivo in termini di memoria, un regime di ottimizzazione specifico dei video e distribuzioni delle rappresentazioni che vincolano insufficientemente la dinamica temporale. Introduciamo ViRDM, un metodo di post-addestramento video privo di insegnante e critico che affronta questi ostacoli in sequenza. Combinando RDM con una supervisione a uscita pulita troncata stocasticamente, un decoder VAE leggero e prodotti vettore-Jacobiano applicati per fasi, ViRDM rende il matching delle distribuzioni delle rappresentazioni compatibile con i vincoli di memoria nelle generazioni causali multi-step. Definiamo inoltre regimi efficaci di popolazione generata e di inizializzazione per l’RDM video e introduciamo una regolarizzazione leggera della dinamica per compensare i vincoli insufficienti sulla dinamica temporale. ViRDM trasforma la distillazione a tre reti in un post-addestramento del solo generatore, riducendo l’uso della memoria GPU e i tempi di addestramento e migliorando al contempo la qualità dei video. Con appena 20 aggiornamenti del generatore, il metodo raggiunge un punteggio di 84,87 nella valutazione ufficiale VBench, superando di 0,36 il precedente miglior modello di riferimento causale in pochi passaggi e richiedendo 16 ore-GPU su A100. Riportiamo inoltre risultati esplorativi che dimostrano il potenziale dello stesso metodo con un budget di campionamento causale inferiore e per la generazione bidirezionale in uno, due e quattro passaggi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv