Vai al contenuto
AI.info

Ricerca

HARMONY: Ragionamento agentico gerarchico per la sintesi da immagine monoculare a scena

La ricostruzione composizionale di scene 3D è stata esplorata di recente in due direzioni: il ragionamento agentico, che offre una comprensione semantica delle relazioni spaziali ma non garantisce un

HARMONY: Ragionamento agentico gerarchico per la sintesi da immagine monoculare a scena
arXiv
2609.26793
Pubblicato
2026-09-22
Autori
Shufan Sun, Chen Wang, Enxin Song, Jiatao Gu, Lingjie Liu

Abstract degli autori

La ricostruzione composizionale di scene 3D è stata esplorata di recente in due direzioni: il ragionamento agentico, che offre una comprensione semantica delle relazioni spaziali ma non garantisce un allineamento preciso con le immagini di input; e i modelli fondazionali di geometria visiva, che prevedono mappe dense di punti a partire dalle immagini di input, ma la cui qualità di ricostruzione è limitata. Ricostruire una scena 3D completa a partire da una singola immagine monoculare, con relazioni accurate tra gli oggetti e una ricostruzione ad alta fedeltà, resta quindi una sfida. In questo articolo presentiamo HARMONY, un framework gerarchico basato su una catena di ragionamento che sfrutta sia il ragionamento agentico sia i modelli fondazionali di geometria visiva. Data l’immagine di una scena interna, HARMONY parte da una planimetria 3D vuota e calibra innanzitutto la telecamera rispetto all’immagine di riferimento, così da definire un sistema di riferimento spaziale fondato semanticamente; utilizza poi il ragionamento agentico di un VLM per ricostruire la disposizione 3D della stanza e stabilire un ordine iniziale di collocazione. Gli oggetti vengono quindi collocati in ordine gerarchico: prima gli elementi fissati alle pareti, poi i mobili indipendenti e infine le decorazioni dipendenti collocate sopra i mobili. Per i mobili utilizziamo anche una visita in profondità, in modo che ogni collocazione sia condizionata dalla struttura già definita, e un ciclo di feedback riflessivo per evitare l’accumulo di errori. Dopo ogni collocazione di un oggetto da parte del VLM, utilizziamo le stime delle nuvole di punti per perfezionare la geometria, così che l’immagine renderizzata corrisponda meglio a quella di input. HARMONY può generare scene 3D semanticamente coerenti e percettivamente allineate con l’immagine di riferimento, estendendo la ricostruzione composizionale da singola immagine a immagini complesse di scene interne. Gli esperimenti su immagini sintetiche e del mondo reale dimostrano che HARMONY supera i metodi di riferimento valutati per la ricostruzione, mentre i confronti qualitativi con GPT-6 Astra suggeriscono disposizioni degli oggetti più fedeli e una migliore conservazione dei dettagli della scena.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv