Vai al contenuto
AI.info

Ricerca

Puffin-World: sviluppo su larga scala di un modello multimodale unificato con stati nativi del mondo 3D

Proponiamo Puffin-World, un’architettura multimodale unificata che integra comprensione della fisica, simulazione spaziale, generazione e ricostruzione di mondi 3D senza ricorrere a moduli esterni off

Puffin-World: sviluppo su larga scala di un modello multimodale unificato con stati nativi del mondo 3D
arXiv
2609.04196
Pubblicato
2026-09-03
Autori
Kang Liao, Yihang Luo, Xiao-Ming Wu, Linyi Jin, Size Wu, Chunyu Lin, Yao Zhao, Fei Wang, Wei Li, Chen Change Loy

Abstract degli autori

Proponiamo Puffin-World, un’architettura multimodale unificata che integra comprensione della fisica, simulazione spaziale, generazione e ricostruzione di mondi 3D senza ricorrere a moduli esterni offline. Per costruire mondi 3D e interagire con essi in modo affidabile, il nostro sistema modella congiuntamente tre stati nativi del mondo: fisica (campo gravitazionale e latitudine), geometria (profondità) e aspetto visivo (immagine), insieme a una rappresentazione unificata Omni-Camera che supporta compiti diversi e movimenti flessibili. Oltre a modellare questi stati, introduciamo una strategia per propagare la dinamica fisica nei fotogrammi futuri. Ancorando le proprietà assolute della fotocamera al mondo reale, Puffin-World consente di generare mondi fisicamente coerenti e visivamente stabili. Inoltre, integriamo aspetto visivo e geometria in un unico processo generativo, sintetizzando congiuntamente ogni vista futura e ricostruendone la geometria sottostante. Questo paradigma unificato consente applicazioni a ciclo chiuso che alternano più compiti e richiedono sinergia tra essi, tra cui l’imitazione e l’esplorazione autocalibrata del mondo. Per estendere Puffin-World a scenari complessi, realizziamo Puffin-16M, composto da 15 milioni di triplette visione-linguaggio-fotocamera e 1 milione di traiettorie caratterizzate da movimenti vari e impegnativi. Per favorire ulteriori ricerche in quest’ambito, abbiamo reso disponibili il codice, i modelli e i dataset.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv