Vai al contenuto
AI.info

Ricerca

WorldSculpt: generare mondi composizionali da video ancorati

Studiamo il problema di generare una rappresentazione 3D composizionale di una scena affollata che contiene centinaia di oggetti. L’obiettivo è rappresentare la scena come un insieme di mesh dei singo

WorldSculpt: generare mondi composizionali da video ancorati
arXiv
2609.05416
Pubblicato
2026-09-04
Autori
Muyao Niu, Jixuan He, Ruihan Yu, Lian Fu, Yonghao Yu, Zheng-Hui Huang, Yifan Zhan, Fengbo Lan, Yongtao Ge, Yinqiang Zheng, Kaipeng Zhang, Zhixiang Wang

Abstract degli autori

Studiamo il problema di generare una rappresentazione 3D composizionale di una scena affollata che contiene centinaia di oggetti. L’obiettivo è rappresentare la scena come un insieme di mesh dei singoli oggetti, collocate in un sistema di riferimento comune, come richiedono applicazioni successive quali videogiochi, AR/VR, simulazione e robotica. Il compito è difficile nelle scene densamente affollate, dove gli oggetti si occludono ampiamente a vicenda e ogni vista ne rivela solo una parte della geometria. Gli approcci basati sulla geometria ricostruiscono in genere la scena come un’unica rappresentazione e lasciano incompleta la geometria nelle regioni occluse, mentre i metodi composizionali esistenti che impiegano prior generativi sono perlopiù limitati a scene relativamente semplici. Mostriamo invece che scene complesse con centinaia di oggetti possono essere generate in modo composizionale adattando un potente prior generativo 3D per singoli oggetti a osservazioni da più punti di vista. Realizziamo questo approccio con Pixal3D, estendendolo con un meccanismo di condizionamento basato su più viste che ancora la generazione degli oggetti a più osservazioni con posa nota. Sebbene il modello sia sottoposto a fine-tuning esclusivamente su singoli oggetti nello spazio canonico, si generalizza a scene ampie con occlusioni marcate senza alcun addestramento a livello di scena, dimostrando la fattibilità e la scalabilità di questo approccio. Presentiamo inoltre UE-MeshyScene, un benchmark fotorealistico di scene densamente affollate con centinaia di oggetti, annotazioni per ciascun oggetto e mesh di riferimento. Nelle valutazioni su singoli oggetti, su più oggetti in condizioni controllate e su UE-MeshyScene, il nostro metodo supera sistematicamente gli approcci precedenti, con vantaggi maggiori all’aumentare della complessità della scena e delle occlusioni. Infine, ne dimostriamo la più ampia applicabilità convertendo mondi 3DGS generati, come Marble e HY-World 2.0, in scene composizionali costituite da mesh.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv