Vai al contenuto
AI.info

Ricerca

Kandinsky 6.0 Video: modelli di base per la generazione sincronizzata di video e audio

Presentiamo Kandinsky 6.0 Video, una famiglia di modelli di diffusione di base per la generazione sincronizzata di audio e video a partire da testo, composta da Kandinsky 6.0 Video Lite (3 miliardi di

Kandinsky 6.0 Video: modelli di base per la generazione sincronizzata di video e audio
arXiv
2610.05608
Pubblicato
2026-10-04
Autori
Team Kandinsky, Julia Agafonova, Bulat Akhmatov, Mikhail Aksyutin, Grigorii Alekseenko, Anastasia Aliaskina, Olga Androsova, Vladimir Arkhipkin, Anna Averchenkova, Alexander Belykh, Serafima Bocharova, Sofiya Bogakovskaya, Anton Bukashkin, Mark Bulygin, Kirill Buzygin, Irina Cheremnykh, Kirill Chernyshev, Mikhail Chernyshov, Vladimir Chernyy, David Chikovani, Georgy Daniltsev, Denis Dimitrov, Anna Dmitrienko, Vladimir Dokholyan, Sergey Emelyanov, Dmitry Ermilov, Georgii Fedorov, Polina Gavrilova, Nikolai Gerasimenko, Aleksandr Gordeev, Andrey Inozemtsev, Andrei Ivaniuta, Alexander Ivanov, Mikhail Karaev, Anastasiia Kargapoltseva, Ivan Kirillov, Nikita Kiselev, Valeria Kobenko, Yury Kolabushin, Denis Koposov, Anatoly Korobov, Vladimir Korviakov, Kirill Kozlov, Denis Krzhivokolskiy, Konstantin Kuklev, Alexander Kunitsyn, Sergey Kuzin, Vladislav Lakhtionov, Alexey Letunovskiy, Maxim Litvinov, Alexander Lyulkov, Georgy Makarov, Kirill Malakhov, Egor Malykh, Mikhail Mamaev, Dmitrii Mikhailov, Polina Mikhailova, Ivan Mikheev, Elizaveta Muromtseva, Nikolai Nazarkin, Tatiana Nikulina, Lev Novitskiy, Stanislav Onuchin, Nikita Osterov, Denis Parkhomenko, Anatoliy Parpara, Vladimir Polovnikov, Konstantin Reznikov, Azat Saginbaev, Nikita Samsonov, Alexander Sentsov, Nikita Shaimov, Artem Sherstyuk, Andrey Shutkin, Egor Silvestrov, Bulat Suleimanov, Matvey Suprunov, Sergey Taranov, Irina Tolstykh, Tatiana Trofimuk, Ilya Trushkin, Aleksandra Tsybina, Olga Varlashina, Viacheslav Vasilev, Ilya Vasiliev, Eugeny Vilisov, Sergey Yakubson, Konstantin Zakharov

Abstract degli autori

Presentiamo Kandinsky 6.0 Video, una famiglia di modelli di diffusione di base per la generazione sincronizzata di audio e video a partire da testo, composta da Kandinsky 6.0 Video Lite (3 miliardi di parametri) e Kandinsky 6.0 Video Pro (29 miliardi di parametri). Entrambi i modelli generano filmati di 5 secondi con audio sincronizzato a 44 kHz, incluso il sincronismo labiale, nelle modalità text-to-audio-video (T2AV) e image-to-audio-video (I2AV); un modello di super-risoluzione integrato porta la risoluzione in uscita al Full-HD (1920$\times$1080). Sulla base delle capacità di generazione video di Kandinsky 5.0, Kandinsky 6.0 Video impiega un’architettura CrossDiT a due flussi che collega un flusso video preaddestrato e un flusso audio addestrato ex novo mediante un meccanismo di cross-attention bidirezionale, per allinearli nel tempo e nel significato. La nostra strategia di preaddestramento continuo addestra dapprima il flusso audio da zero su corpora audio di vasta scala, poi addestra congiuntamente entrambi i flussi su dati audio-video abbinati, preservando la fedeltà delle singole modalità; al preaddestramento seguono il fine-tuning supervisionato, il post-addestramento basato sull’apprendimento per rinforzo e la distillazione. In una valutazione comparativa affiancata condotta da persone, Kandinsky 6.0 Video Pro supera nettamente il suo predecessore, Kandinsky 5.0 Video Pro, e resta competitivo rispetto ai principali modelli di generazione audio-video, soprattutto per la qualità del parlato. Per accelerare la ricerca aperta e l’impiego nella generazione multimediale, rendiamo disponibili il codice, i checkpoint dei modelli e l’integrazione con diffusers con licenza MIT.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv