Vai al contenuto
AI.info

Ricerca

Astronex-World 1.0: modello fondazionale del mondo interattivo in tempo reale

Presentiamo Astronex-World 1.0, un modello fondazionale del mondo video aperto e controllabile. A partire da un prompt testuale (text-to-video) o da un’osservazione iniziale (image-to-video), il model

Astronex-World 1.0: modello fondazionale del mondo interattivo in tempo reale
arXiv
2609.20034
Pubblicato
2026-09-17
Autori
Xin Zhou, Cong Miao

Abstract degli autori

Presentiamo Astronex-World 1.0, un modello fondazionale del mondo video aperto e controllabile. A partire da un prompt testuale (text-to-video) o da un’osservazione iniziale (image-to-video), il modello prevede gli stati visivi futuri in base a traiettorie della telecamera allineate ai fotogrammi, azioni continue e un identificativo dell’embodiment; accetta inoltre eventi testuali inseriti in una posizione specifica di un rollout. La famiglia comprende un modello bidirezionale per la generazione con contesto completo e un modello causale con attenzione block-causal e caching KV tra blocchi per la generazione persistente, entrambi basati sul prior Wan2.2-TI2V-5B. PRoPE introduce i parametri intrinseci ed estrinseci della telecamera, mentre un flusso di azioni a 64 dimensioni modula ogni livello Transformer. Un percorso di addestramento in cinque fasi sviluppa il controllo bidirezionale di telecamera e azioni, converte il backbone alla generazione block-causal, distilla un modello studente a pochi passaggi, ripristina le dinamiche dei domini misti e applica il matching asimmetrico della distribuzione DMD/DMD2. Il modello causale genera video a 832x480 e 24 fps. Tutte e cinque le fasi di addestramento vengono eseguite su due GPU NVIDIA L20 da 48 GB, mentre il modello causale trasmette in streaming in tempo reale su una GPU. Ottiene un punteggio di 73,5 su WBench Navi e di 70,0 su WBench Full. Su Full, questo modello da 5B supera LongCat-Video da 13,6B e Helios da 14B, resta a meno di un punto dal modello LTX-2.3 da 22B e supera YUME 1.5, sottoposto a post-training a partire dallo stesso prior da 5B su GPU NVIDIA A100. Le interfacce riservate di input e output delle azioni consentono il post-training per l’intelligenza incarnata e la guida autonoma.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv