Ricerca
DreamX-Creator: democratizzare la generazione audio-video nativa alla risoluzione 2K
I recenti generatori video spesso omettono l’audio o lo sintetizzano in una fase separata, limitando la modellazione reciproca delle dinamiche visive e degli eventi acustici. Presentiamo DreamX-Creato

- arXiv
- 2608.31106
- Pubblicato
- 2026-08-31
- Autori
- Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu
Abstract degli autori
I recenti generatori video spesso omettono l’audio o lo sintetizzano in una fase separata, limitando la modellazione reciproca delle dinamiche visive e degli eventi acustici. Presentiamo DreamX-Creator 1.0, un sistema compatto per la generazione congiunta e nativa di audio e video, basato su un generatore da 7B. Condizionato da un primo fotogramma e da un prompt testuale, il generatore rimuove congiuntamente il rumore da flussi audio e video specializzati per modalità. I flussi vengono elaborati indipendentemente nella prima metà della rete e collegati nella seconda metà tramite Gated Cross-Modal Attention, i cui gate di uscita, specifici per token e per testa, modulano l’uscita di ciascuna testa attiva dell’attenzione cross-modale. Un sistema unificato Audio-Video Data System crea e filtra clip temporalmente coerenti, produce annotazioni multimodali strutturate e organizza le clip in insiemi di dati orientati a capacità specifiche. Progressive Joint Training comprende due fasi di pre-training audio-video seguite da High-Quality Finetuning. Audio-Video Reinforcement Learning sottopone poi il generatore a un ulteriore addestramento con Modality-Aware Multimodal Feedback, che indirizza i feedback relativi al video, all’audio e alle interazioni cross-modali verso i flussi corrispondenti. Per ottenere risultati ad alta risoluzione, la nostra pipeline Autoregressive 1-Step 2K Refinement adatta un modello insegnante bidirezionale a più passi trasformandolo in un modello di raffinamento autoregressivo a più passi, per poi distillarlo in un modello studente che richiede una sola valutazione della rimozione del rumore per segmento temporale. Nel complesso, DreamX-Creator 1.0 realizza una generazione audio-video nativa e sincronizzata, con prestazioni competitive rispetto ai sistemi open source più avanzati. Rendendo disponibili il nostro generatore compatto da 7B e il 2K Refiner, puntiamo a democratizzare la generazione audio-video nativa e a fornire una base accessibile per la ricerca futura sulla modellazione generativa unificata di audio e video.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv