Ricerca
LynnReal-Omni: generazione video multimodale nativa per flussi di lavoro visivi agentici
I modelli di diffusione video sono stocastici e difficili da controllare: ottenere contenuti precisi richiede spesso campionamenti ripetuti, senza garanzia di successo, e nelle scene di lunga durata l

- arXiv
- 2609.15863
- Pubblicato
- 2026-09-14
- Autori
- Xiaofeng Mao, Peijia Lin, Shaohao Rui, Yibo Zhang, Haibin Wan, Weijie Ma
Abstract degli autori
I modelli di diffusione video sono stocastici e difficili da controllare: ottenere contenuti precisi richiede spesso campionamenti ripetuti, senza garanzia di successo, e nelle scene di lunga durata l’aspetto, le interazioni e la coerenza temporale tendono a variare. La creazione visiva agentica offre riferimenti espliciti, scene 3D modificabili o stati di gioco eseguibili per un controllo stabile, ma da sola non garantisce un’elevata fedeltà di oggetti o personaggi. Combinare i due approcci può consentire una generazione stabile e di alta qualità. Per realizzare questa combinazione, presentiamo LynnReal-Omni, un framework nativo di generazione video multimodale basato su un transformer multimodale a diffusione condiviso da 32B, che unifica la generazione di video da testo, la generazione condizionata da immagini, la generazione guidata da riferimenti, il controllo strutturale, l’editing, il ripristino di video degradati e la generazione di video lunghi. Accetta input visivi eterogenei, tra cui riferimenti per l’aspetto, rendering 3D modificabili e registrazioni di giochi, consentendo agli agenti di comporre condizioni visive all’interno di un modello unificato. Addestriamo inoltre un transformer multimodale a diffusione condiviso Flash da 27B, dedicato al rendering in tempo reale. Realizziamo una pipeline sistematica di dati per la pulizia dei video, l’associazione dei soggetti, l’annotazione multimodale e la costruzione di controlli allineati, ottenendo un corpus selezionato di segmenti audiovisivi composti da più inquadrature. Introduciamo inoltre MSAVP, un sistema di valutazione con 100 prompt e 20 metriche che distingue il rispetto delle istruzioni, la plausibilità di quanto generato, la qualità visiva, il comportamento temporale e il coordinamento audio. LynnReal-Omni-Flash riduce ulteriormente il costo dell’inferenza accelerando il modello e la decodifica, anche grazie a un decoder VAE leggero; su una H100, la generazione a caldo e la decodifica di un video a 540p di 22 fotogrammi richiedono 843 ms con LynnReal-Omni e 377 ms con Flash. Questi risultati pongono le basi per la generazione di video in streaming in tempo reale, rendendo LynnReal-Omni una base unificata, controllabile ed efficiente per la creazione visiva agentica.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv