Ricerca
Imagine3D-LLM: insegnare agli MLLM a immaginare scene 3D prima di rispondere
Ragionare sul mondo 3D a partire da immagini riprese da più punti di vista resta una sfida fondamentale per i grandi modelli linguistici multimodali (MLLM). Sebbene gli MLLM moderni gestiscano efficac

- arXiv
- 2609.38177
- Pubblicato
- 2026-09-29
- Autori
- Jaewoo Jung, Hyeonseo Yu, Honggyu An, Jisang Han, Mungyeom Kim, Minkyeong Jeon, Heeseong Shin, Wonjun Moon, Federico Tombari, Daniel Barath, Marc Pollefeys, Seungryong Kim, Sunghwan Hong
Abstract degli autori
Ragionare sul mondo 3D a partire da immagini riprese da più punti di vista resta una sfida fondamentale per i grandi modelli linguistici multimodali (MLLM). Sebbene gli MLLM moderni gestiscano efficacemente le immagini singole, faticano a integrare le informazioni provenienti da punti di vista diversi in una comprensione coerente dello spazio 3D. Un numero crescente di studi cerca di colmare questa lacuna dotando gli MLLM di consapevolezza 3D: alcuni migliorano la corrispondenza dettagliata, a livello di pixel, tra le diverse viste; altri combinano le caratteristiche estratte da foundation model per la geometria 3D. Resta però un divario considerevole rispetto al ragionamento umano. In questo lavoro torniamo a esaminare il ragionamento spaziale umano, che suggerisce un processo diverso: anziché affidarsi a indizi geometrici dettagliati, gli esseri umani identificano approssimativamente gli oggetti comuni alle diverse viste, deducono la geometria relativa tra i punti di vista e compongono una rappresentazione 3D sommaria della scena. Ispirandoci a questo processo, presentiamo Imagine3D-LLM, un MLLM che impara a costruire una rappresentazione 3D altrettanto compatta della scena e basa la propria risposta su di essa. In concreto, aggiungiamo un piccolo insieme di token di sintesi apprendibili dopo i token delle immagini, li decodifichiamo in una rappresentazione compatta di 3D Gaussian Splatting supervisionata da una perdita di ricostruzione fotometrica e addestriamo il modello congiuntamente con l’obiettivo standard di previsione del token successivo. È significativo che, sebbene solo i token di sintesi ricevano una supervisione diretta per la ricostruzione, questo obiettivo rafforzi anche la corrispondenza tra fotogrammi nelle caratteristiche delle immagini sottostanti dell’LLM. Ciò suggerisce che imparare a ricostruire propaghi segnali legati alla comprensione 3D in tutto il modello. Di conseguenza, Imagine3D-LLM supera sistematicamente gli approcci precedenti in diversi benchmark di ragionamento spaziale e comprensione 3D, suggerendo che immaginare la scena possa essere più efficace che ricevere informazioni sulla sua geometria a livello di pixel.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv