Vai al contenuto
AI.info

Ricerca

Mira-Scene: layout allineati ai pixel per la ricostruzione generativa di scene 3D

La generazione di oggetti 3D a partire da una singola immagine è oggi in grado di produrre risorse di alta fedeltà, ma collocarle con precisione in una disposizione coerente della scena resta una sfid

Mira-Scene: layout allineati ai pixel per la ricostruzione generativa di scene 3D
arXiv
2609.23796
Pubblicato
2026-09-20
Autori
Yang-Tian Sun, Tianjia Liu, Zehuan Huang, Yi-Hua Huang, Xiaoyang Lyu, Ziyi Yang, Zi-Xin Zou, Yuan-Chen Guo, Yan-Pei Cao, Xiaojuan Qi

Abstract degli autori

La generazione di oggetti 3D a partire da una singola immagine è oggi in grado di produrre risorse di alta fedeltà, ma collocarle con precisione in una disposizione coerente della scena resta una sfida aperta. Una difficoltà centrale riguarda il modo in cui viene rappresentata la disposizione degli oggetti. I metodi olistici integrano il posizionamento in un processo di generazione a livello di scena, sacrificando i dettagli a livello di oggetto. I metodi composizionali preservano la fedeltà degli oggetti separando la geometria dalla disposizione, ma in genere parametrizzano quest’ultima come variabili di posa sparse e non limitate, difficili da apprendere e scarsamente generalizzabili quando la supervisione a livello di scena è limitata. Presentiamo Mira-Scene, un framework composizionale per la ricostruzione di scene 3D che sostituisce la regressione di pose sparse con il recupero di corrispondenze dense e limitate. Al suo centro c’è la Canonical Coordinate Map (CCM), un campo allineato ai pixel che mappa ogni pixel visibile di un oggetto in una coordinata della superficie nello spazio canonico limitato dell’oggetto. In combinazione con una Point Cloud Map (PCM) nello spazio della scena, ottenuta tramite stima della geometria monoculare, la CCM induce corrispondenze dense tra spazio canonico e scena, dalle quali si ricavano le trasformazioni degli oggetti mediante un allineamento geometrico robusto. Poiché opera in uno spazio canonico limitato, la CCM fornisce un obiettivo di previsione stabile, che può essere addestrato usando dati 3D scalabili a livello di oggetto senza richiedere annotazioni della disposizione a livello di scena. Mira-Scene introduce inoltre un transformer di diffusione multimodale che genera congiuntamente la geometria degli oggetti e le CCM, usando flussi esperti specifici per ciascuna modalità con attenzione e codifica posizionale condivise per favorire la coerenza tra geometria e disposizione. Gli esperimenti condotti su scene di interni, esterni, sintetiche e del mondo reale mostrano che Mira-Scene supera nettamente baseline competitive in termini di accuratezza della disposizione, ottenendo miglioramenti relativi del 39,8% in 3D-IoU e del 16,5% in 2D-IoU rispetto a SAM3D, usando dati di addestramento open source limitati.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv