Vai al contenuto
AI.info

Ricerca

SPW-Nav: un modello del mondo panoramico in streaming per la navigazione guidata dal linguaggio

La generazione di video panoramici guidata dal linguaggio è utile per diverse applicazioni, tra cui l’esplorazione interattiva di scene 3D, le esperienze di realtà virtuale e l’addestramento di agenti

SPW-Nav: un modello del mondo panoramico in streaming per la navigazione guidata dal linguaggio
arXiv
2610.08941
Pubblicato
2026-10-06
Autori
Yunheng Liu, Ziqi Cai, Siqi Yang, Yimu Wang, Minggui Teng, Jiaming Tan, Shuchen Weng, Erwin Wu, Kaipeng Zhang, Boxin Shi

Abstract degli autori

La generazione di video panoramici guidata dal linguaggio è utile per diverse applicazioni, tra cui l’esplorazione interattiva di scene 3D, le esperienze di realtà virtuale e l’addestramento di agenti embodied. I generatori panoramici esistenti seguono traiettorie predefinite, mentre i modelli del mondo interattivi operano attraverso azioni di basso livello in viste prospettiche. Proponiamo SPW-Nav, un modello del mondo panoramico in streaming che comprende le istruzioni di movimento e, a partire da un solo panorama, trasmette in tempo reale un minuto di video a 360 gradi in 2K. SPW-Nav interpreta ogni istruzione come un movimento della camera nel panorama generato in precedenza. Il disaccoppiamento della rotazione sferica applica la rotazione esattamente sulla sfera, il condizionamento allineato alla posa mantiene limitati gli input di traslazione durante lunghi flussi e una memoria a più termini, insieme a un generatore che richiede pochi passaggi, permette di proseguire la scena al cambiare delle istruzioni. Realizziamo inoltre SPW-NavSet, composto da video panoramici con traiettorie della camera e istruzioni verificate. Guidato dal linguaggio, SPW-Nav supera i precedenti generatori panoramici per precisione nel seguire i movimenti della camera e qualità video, e consente di cambiare istruzioni in corso d’opera.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv