Ricerca
Matrix-Game 3.5: modelli interattivi del mondo con streaming in tempo reale migliorati grazie alla memoria a patch
I modelli interattivi del mondo portano la generazione video oltre la sintesi offline di clip, verso la simulazione persistente di mondi virtuali interattivi, rendendo possibili applicazioni nei video

- arXiv
- 2608.29910
- Pubblicato
- 2026-08-30
- Autori
- Runjia Qian, Zile Wang, Jihai Zhang, Kai Zou, Wei Yu, Jiaxing Li, Zexiang Liu, Yaokun Li, Fei Kang, Kaichen Huang, Mengyin An, Haobo Zhang, Biao Jiang, Jiahua Wang, Haofeng Sun, Yang Liu, Yangguang Li
Abstract degli autori
I modelli interattivi del mondo portano la generazione video oltre la sintesi offline di clip, verso la simulazione persistente di mondi virtuali interattivi, rendendo possibili applicazioni nei videogiochi, nella robotica, negli agenti incarnati e nella XR. Ottenere una generazione interattiva stabile su orizzonti lunghi resta però difficile: il modello deve preservare allo stesso tempo la geometria della scena, la coerenza dinamica e il controllo della telecamera, supportando al contempo la generazione autoregressiva in tempo reale. Partendo da Matrix-Game 3.0, presentiamo Matrix-Game 3.5, illustrato nella Figura 1, che avvicina la generazione interattiva di mondi in tempo reale a una simulazione consapevole della geometria e coerente su orizzonti lunghi grazie a tre miglioramenti principali. Primo, proponiamo un framework unificato di memoria consapevole della geometria, le cui componenti patch-memory e tiled-PRoPE non introducono ulteriori parametri apprendibili e combinano il recupero esplicito di patch 3D con il condizionamento proiettivo della telecamera, consentendo un controllo della telecamera coerente con la geometria e un recupero fedele delle scene su orizzonti lunghi. Secondo, introduciamo una rappresentazione del mondo che separa le componenti statiche da quelle dinamiche, modellando distintamente la geometria statica della scena e i soggetti dinamici per preservare sia la coerenza geometrica sia l’identità dei soggetti durante la generazione su orizzonti lunghi. Terzo, sviluppiamo un framework di distillazione progressiva in tempo reale in due fasi, che trasforma un modello di diffusione bidirezionale in un generatore causale a pochi passaggi mediante Perceptual Flow Matching e Self-Rollout DMD basato su curriculum, consentendo una generazione interattiva in tempo reale della durata di un minuto. Esperimenti approfonditi dimostrano che, con un corpus di addestramento unificato che comprende ambienti di simulazione Unreal, giochi open world e video tratti da Internet, MatrixGame 3.5 ottiene risultati elevati nel recupero delle scene su orizzonti lunghi, nel controllo preciso della telecamera, nella coerenza dei soggetti, nella generazione di mondi guidata da prompt e nell’interazione stabile in tempo reale in mondi aperti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv