Vai al contenuto
AI.info

Ricerca

SceneMosaic: generazione efficiente e diversificata di scene pronte per la simulazione attraverso l’evoluzione agentica ibrida dei layout

Scene d’interni diversificate e pronte per la simulazione sono essenziali per l’intrattenimento interattivo e l’IA incarnata, ma generarle su larga scala resta difficile. Le recenti pipeline agentiche

SceneMosaic: generazione efficiente e diversificata di scene pronte per la simulazione attraverso l’evoluzione agentica ibrida dei layout
arXiv
2609.05594
Pubblicato
2026-09-04
Autori
Xingjian Ran, Xiaoye Mo, Sihao Liu, Jianyu Zhang, Li Luo, Bo Dai

Abstract degli autori

Scene d’interni diversificate e pronte per la simulazione sono essenziali per l’intrattenimento interattivo e l’IA incarnata, ma generarle su larga scala resta difficile. Le recenti pipeline agentiche che generano scene 3D a partire da testo usando modelli visivo-linguistici (VLM) possono produrre scene di alta qualità, ma richiedono costose iterazioni per collocare e perfezionare gli oggetti. Un altro approccio diffuso, basato su modelli parametrici che generano scene 3D a partire da immagini, produce scene in modo efficiente grazie a solide conoscenze a priori apprese da immagini 2D, ma spesso dà risultati imprecisi e fisicamente non validi. Soprattutto, entrambi gli approcci faticano a produrre scene diverse per un unico input, rendendo difficile rappresentare la natura dinamica delle scene reali. In questo articolo proponiamo \textbf{SceneMosaic}, un framework che combina i punti di forza dei due approcci. Ottiene una proposta iniziale dalle conoscenze a priori apprese dalle immagini e poi la fa evolvere tramite agenti VLM, garantendo sia efficienza sia validità fisica. Durante l’evoluzione, SceneMosaic sfrutta la località delle scene naturali e scompone una scena in unità locali indipendenti, che possono evolvere separatamente prima di comporre la scena globale tramite il prodotto cartesiano. Su SceneEval-100, SceneMosaic eguaglia la migliore baseline agentica nella qualità semantica del layout con una velocità 24 volte superiore, riduce sensibilmente le violazioni dei vincoli fisici e ottiene le valutazioni umane più alte. Il nostro codice è disponibile pubblicamente all’indirizzo https://github.com/rxjfighting/SceneMosaic.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv