Vai al contenuto
AI.info

Ricerca

AlayaVista: modellazione del mondo in streaming dagli stati panoramici ai video in prospettiva

I modelli del mondo per video interattivi devono mantenere un ampio contesto della scena mentre la telecamera si muove, producendo osservazioni ad alta fedeltà con bassa latenza. Gli approcci esistent

AlayaVista: modellazione del mondo in streaming dagli stati panoramici ai video in prospettiva
arXiv
2609.14462
Pubblicato
2026-09-13
Autori
Jiaming Tan, Mingliang Zhai, Zhen Li, Yuwei Wu, Chuanhao Li, Kaipeng Zhang

Abstract degli autori

I modelli del mondo per video interattivi devono mantenere un ampio contesto della scena mentre la telecamera si muove, producendo osservazioni ad alta fedeltà con bassa latenza. Gli approcci esistenti devono affrontare un compromesso nella rappresentazione: i modelli prospettici operano su viste locali e devono conservare i contenuti fuori campo durante lunghe sequenze generate, mentre una copertura spaziale più ampia si ottiene generalmente sintetizzando video dell’intera sfera o costruendo rappresentazioni 3D esplicite. Ispirandoci ai ruoli complementari del contesto globale e dell’acutezza locale selettiva nella percezione visiva, presentiamo AlayaVista, un modello del mondo per video in streaming controllabile tramite telecamera, che separa l’evoluzione panoramica del mondo dalla sintesi delle osservazioni in prospettiva. A partire da una singola immagine in prospettiva, AlayaVista costruisce una rappresentazione preliminare della scena a 360 gradi usando un modello preaddestrato di espansione panoramica, quindi fa evolvere la scena come stato latente panoramico condizionato dalla telecamera. Un renderer latente della finestra di visualizzazione trasforma questo stato nelle rappresentazioni latenti del video in prospettiva richiesto, mentre un modulo di rifinitura prospettica ripristina i dettagli, riduce gli artefatti ed esegue la super-risoluzione. Per rendere efficiente lo streaming, adattiamo il generatore panoramico alla generazione autoregressiva a blocchi e distilliamo sia la generazione panoramica sia la rifinitura prospettica in processi che richiedono pochi passaggi. Per fornire i dati di supervisione necessari a questa architettura, realizziamo MUGEN, un dataset su larga scala di video panoramici del mondo reale che contiene 1.318 ore di video con risoluzioni di almeno 4K, accompagnati da ricche annotazioni semantiche e geometriche.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv