Ricerca
Lucida: analizzare, generare e posizionare per modellare scene componibili dal reale alla simulazione
La modellazione di scene componibili mira a ricostruire una scena reale d’interni sotto forma di asset di oggetti completi e modificabili, disposti come osservati. Il risultato è una replica dell’ambi

- arXiv
- 2608.30821
- Pubblicato
- 2026-08-31
- Autori
- Minghan Qin, Yuang Wang, Xiuyu Yang, Yushi Long, Yujian Zhang, Ruihuan Wang, Kai Ye, Yangang Zhang, Hang Li
Abstract degli autori
La modellazione di scene componibili mira a ricostruire una scena reale d’interni sotto forma di asset di oggetti completi e modificabili, disposti come osservati. Il risultato è una replica dell’ambiente reale pronta per la simulazione robotica e l’IA incarnata, i cui oggetti possono essere manipolati singolarmente. Le procedure esistenti suddividono il compito in tre fasi — analizzare le osservazioni per individuare le singole istanze, generare un asset per ciascuna e riposizionare ogni asset — ma ciascuna fase presuppone dati che l’acquisizione di una scena ingombra raramente fornisce: geometrie accurate delle singole istanze, viste prive di occlusioni e asset che corrispondano fedelmente alle osservazioni. Proponiamo Lucida, che mantiene quest’ordine ma ridistribuisce i requisiti: ogni fase utilizza soltanto ciò che un’acquisizione reale fornisce in modo affidabile, e la precisione viene raggiunta alla fine del processo anziché richiesta fin dall’inizio. Lucida analizza il video per costruire un grafo della scena i cui nodi contengono evidenze multivista per ciascuna istanza, genera da tali evidenze un asset completo per ogni istanza e posiziona gli asset con GizmoAct, una policy VLM che tratta il posizionamento come un’interazione con la GUI in più turni, manipola il gizmo dell’oggetto in un ciclo a feedback e decide autonomamente quando l’allineamento è raggiunto. Nei compiti di rilevamento di oggetti 3D a livello di scena, stima della posa degli oggetti e ricostruzione della scena, Lucida aumenta la mAP del 69% rispetto a Boxer su R2S-Scene, porta ADD-SB@0.05 dal 57,8% all’83,4% su CA-1M e fa salire l’F-Score della scena dallo 0,794 di SAM3D a 0,924.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv