Ricerca
SceneMosaic: generazione efficiente e diversificata di scene pronte per la simulazione attraverso l’evoluzione agentica ibrida dei layout
Scene d’interni diversificate e pronte per la simulazione sono essenziali per l’intrattenimento interattivo e l’IA incarnata, ma generarle su larga scala resta difficile. Le recenti pipeline agentiche

- arXiv
- 2609.05594
- Pubblicato
- 2026-09-04
- Autori
- Xingjian Ran, Xiaoye Mo, Sihao Liu, Jianyu Zhang, Li Luo, Bo Dai
Abstract degli autori
Scene d’interni diversificate e pronte per la simulazione sono essenziali per l’intrattenimento interattivo e l’IA incarnata, ma generarle su larga scala resta difficile. Le recenti pipeline agentiche che generano scene 3D a partire da testo usando modelli visivo-linguistici (VLM) possono produrre scene di alta qualità, ma richiedono costose iterazioni per collocare e perfezionare gli oggetti. Un altro approccio diffuso, basato su modelli parametrici che generano scene 3D a partire da immagini, produce scene in modo efficiente grazie a solide conoscenze a priori apprese da immagini 2D, ma spesso dà risultati imprecisi e fisicamente non validi. Soprattutto, entrambi gli approcci faticano a produrre scene diverse per un unico input, rendendo difficile rappresentare la natura dinamica delle scene reali. In questo articolo proponiamo \textbf{SceneMosaic}, un framework che combina i punti di forza dei due approcci. Ottiene una proposta iniziale dalle conoscenze a priori apprese dalle immagini e poi la fa evolvere tramite agenti VLM, garantendo sia efficienza sia validità fisica. Durante l’evoluzione, SceneMosaic sfrutta la località delle scene naturali e scompone una scena in unità locali indipendenti, che possono evolvere separatamente prima di comporre la scena globale tramite il prodotto cartesiano. Su SceneEval-100, SceneMosaic eguaglia la migliore baseline agentica nella qualità semantica del layout con una velocità 24 volte superiore, riduce sensibilmente le violazioni dei vincoli fisici e ottiene le valutazioni umane più alte. Il nostro codice è disponibile pubblicamente all’indirizzo https://github.com/rxjfighting/SceneMosaic.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv