Ricerca
SolarWM: dati aperti e addestramento scalabile per modelli del mondo video a lungo orizzonte
Presentiamo SolarWM, una base completamente aperta per costruire modelli del mondo video interattivi, dalla preparazione dei dati all’inferenza su lunghi orizzonti temporali. L’addestramento su fonti

- arXiv
- 2609.02886
- Pubblicato
- 2026-09-02
- Autori
- Junchao Huang, Guian Fang, Shengju Qian, Xianghao Kong, Zhuoran Zhao, Wei Huang, Yihua Du, Zixin Zhang, Justin Cui, Yuchao Gu, Yukang Chen, Xinting Hu, Tianyu He, Shaoshuai Shi, Zhuotao Tian, Xin Wang, Mike Zheng Shou, Li Jiang
Abstract degli autori
Presentiamo SolarWM, una base completamente aperta per costruire modelli del mondo video interattivi, dalla preparazione dei dati all’inferenza su lunghi orizzonti temporali. L’addestramento su fonti di dati eterogenee e diversi backbone video è impegnativo: i dataset differiscono per scala temporale, geometria della telecamera, qualità visiva, movimento e stile delle didascalie, mentre i generatori video usano rappresentazioni e architetture differenti. La semplice combinazione dei dati e le implementazioni specifiche per ciascun modello producono quindi una supervisione incoerente e rendono difficile riprodurre e confrontare i risultati. SolarWM affronta questa interdipendenza con un motore riconfigurabile per dati provenienti da più fonti e un framework di adattamento nativo per ciascun backbone. Il motore converte 1,43 milioni di clip canoniche provenienti da 10 dataset in uno schema unificato e allineato ai fotogrammi, che comprende osservazioni visive, geometria metrica della telecamera, didascalie, metadati sulla qualità, decisioni di selezione e provenienza, separando al contempo l’elaborazione delle fonti dalla costruzione delle combinazioni di dati. Con interfacce comuni per il condizionamento basato sulla telecamera, l’addestramento e l’inferenza, realizziamo quattro modelli da 5B a 33B basati su Wan2.2, LTX-2.5 e MiniMax-H3, preservandone le rappresentazioni e gli obiettivi nativi. Una procedura unificata in tre fasi combina adattamento bidirezionale, inizializzazione autoregressiva con teacher forcing e distillazione mediante corrispondenza delle distribuzioni. I modelli causali risultanti consentono l’interazione in tempo reale su sequenze generate di durata compresa tra minuti e ore, pur essendo stati addestrati solo su sequenze di 5 s. Rendendo disponibili i dati, la pipeline, le procedure, i pesi e il framework risultanti, SolarWM offre una base riproducibile ed estensibile per la ricerca sui modelli del mondo interattivi.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv