Ricerca
LEGO-Anything: agenti di programmazione per la ricostruzione di scene 3D
Una scena 3D ricostruita a partire da una sola immagine è più utile se viene rappresentata non come un rendering o un risultato 3D fisso, ma come un programma esplicito la cui esecuzione produce una s

- arXiv
- 2609.36380
- Pubblicato
- 2026-09-28
- Autori
- Xirui Li, Peng Shi, Mingwen Dong, Sheng Zhang, Zhuoyan Xu, Dongkyu Lee, Shuaichen Chang, Yi Xiang, Lin Pan, Jiarong Jiang
Abstract degli autori
Una scena 3D ricostruita a partire da una sola immagine è più utile se viene rappresentata non come un rendering o un risultato 3D fisso, ma come un programma esplicito la cui esecuzione produce una scena che si può esaminare, modificare e interrogare. Presentiamo LEGO-Anything, un framework Image-to-Code in cui un agente di programmazione scrive ed esegue iterativamente codice Blender, esamina scene e rendering e rivede il programma. Per valutare la ricostruzione delle scene dall’inizio alla fine, introduciamo LEGO-Bench, un benchmark basato su un simulatore che comprende 208 immagini di 104 diverse scene in ambienti interni ed esterni. LEGO-Bench assegna punteggi distinti alla validità degli artefatti, alla geometria delle superfici visibili e all’aspetto nel rendering. La sua struttura basata su un simulatore consente di estenderlo e di effettuare valutazioni automatiche precise. Tra gli agenti valutati, GPT-6-astra ottiene i migliori risultati complessivi, con punteggi del 53,4% per gli interni e del 39,6% per gli esterni. Restano tuttavia divari notevoli tra la capacità di produrre artefatti di scena validi e quella di ricostruire fedelmente geometria e aspetto della scena. L’analisi delle sequenze di costruzione degli agenti rivela tre problemi ricorrenti: un’inizializzazione carente della scena, modifiche che peggiorano il risultato nel corso delle iterazioni e un’autovalutazione inaffidabile. Questi risultati motivano LEGO-Plugin, un plugin per l’ambiente di esecuzione che non richiede addestramento e consente una costruzione iterativa delle scene più controllata. LEGO-Plugin migliora i risultati di tutti e sei i modelli valutati, con incrementi relativi fino al 62,7% nel punteggio complessivo. Infine, verifichiamo se le scene ricostruite possano rappresentare immagini naturali e supportare compiti di visione artificiale. In LEGO-World ricaviamo rilevamenti degli oggetti, maschere delle istanze e profondità relativa mediante interrogazioni deterministiche delle scene ricostruite da GPT-6-astra. I risultati così ottenuti mostrano prestazioni non trascurabili in tutti e tre i compiti, ma restano nettamente inferiori a quelle dei modelli specializzati di visione artificiale. Ciò suggerisce che le scene costruite tramite programmi dagli attuali agenti di programmazione siano una rappresentazione promettente delle immagini naturali, ma non ancora sufficientemente precisa.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv