Vai al contenuto
AI.info

Ricerca

HelixWorld: un modello di mondo audiovisivo interattivo in tempo reale

La simulazione del mondo è per sua natura multisensoriale e richiede dinamiche visive e acustiche sincronizzate in tempo reale. Eppure, i modelli di mondo interattivi prevalenti restano del tutto sile

HelixWorld: un modello di mondo audiovisivo interattivo in tempo reale
arXiv
2609.38123
Pubblicato
2026-09-29
Autori
Lei Ke, Jiahao Pan, Zeyue Tian, Jiaming Wang, Haoyuan Huang, Kam Man Wu, Pengjun Fang, Hongyu Liu, Chenyang Qi, Lin Wang, Ruibin Yuan, Weijia Chen, Fangneng Zhan, Qifeng Chen, Wei Xue, Yike Guo

Abstract degli autori

La simulazione del mondo è per sua natura multisensoriale e richiede dinamiche visive e acustiche sincronizzate in tempo reale. Eppure, i modelli di mondo interattivi prevalenti restano del tutto silenziosi: si concentrano esclusivamente sulla resa visiva e sul controllo, trascurando la dimensione acustica. Presentiamo HelixWorld, un modello di mondo audiovisivo interattivo in tempo reale nel quale le scene visive e il suono stereo spaziale ancorato alla telecamera evolvono insieme, in modo nativo, attraverso l’interazione con l’utente. Abbiamo creato un dataset audiovisivo spaziale ad alta fedeltà, con acustica stereo reale e pose metriche della telecamera, sul quale pre-addestriamo un modello teacher bidirezionale condizionato dalle traiettorie della telecamera a 6-DoF e dalle azioni dell’utente. Per consentire interazioni causali a bassa latenza, distilliamo il modello teacher in un modello student per lo streaming che richiede pochi passaggi, mediante una funzione di perdita per la distillazione online delle traiettorie. Questo permette di mantenere sequenze audiovisive congiunte prive di deriva a 24 FPS su una sola GPU. Formalizziamo inoltre la coerenza acustico-spaziale e introduciamo HelixBench per valutare se i campi sonori sintetizzati seguano fedelmente il movimento dinamico del punto di vista. Numerosi esperimenti mostrano che HelixWorld eguaglia i modelli di mondo silenziosi più avanzati per fedeltà visiva e reattività, superando nettamente le baseline esistenti nell’immersione acustico-spaziale allineata alla telecamera.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv