Ricerca
SpatialBlock: potenziare l’intelligenza spaziale nei LVLM attraverso un problema sintetico di impilamento di blocchi
I grandi modelli visivo-linguistici (LVLM) hanno ottenuto prestazioni elevate in diversi compiti visivi, ma la loro capacità di ricostruire la struttura 3D della scena raffigurata in immagini 2D e di

- arXiv
- 2609.07064
- Pubblicato
- 2026-09-07
- Autori
- Soohyun Ryu, Sohee Kim, Eunho Yang
Abstract degli autori
I grandi modelli visivo-linguistici (LVLM) hanno ottenuto prestazioni elevate in diversi compiti visivi, ma la loro capacità di ricostruire la struttura 3D della scena raffigurata in immagini 2D e di ragionare su di essa — una capacità definita intelligenza spaziale — resta limitata. Gli approcci esistenti cercano di colmare questa lacuna usando dataset di domande e risposte spaziali su scene reali, che richiedono annotazioni geometriche dettagliate. Creare queste etichette, tuttavia, è costoso, richiede tempo e spesso produce risultati imprecisi a causa della dipendenza da moduli esterni di percezione. In questo lavoro proponiamo un nuovo paradigma ispirato allo sviluppo cognitivo umano: apprendere abilità spaziali fondamentali attraverso compiti strutturati di manipolazione di blocchi. Presentiamo SpatialBlock-15k, un dataset sintetico di 15.000 problemi di impilamento di blocchi che comprendono la proiezione dal 3D al 2D, la trasformazione del punto di vista e la combinazione strutturale. Il dataset incorpora inoltre una modulazione controllata dei colori come indizio visivo per incoraggiare il ragionamento basato su punti di riferimento in condizioni visivamente complesse. Gli esperimenti mostrano che i LVLM addestrati sul nostro dataset, sia a rispondere direttamente sia a formulare previsioni basate sul ragionamento, superano nettamente i modelli di riferimento e generalizzano a compiti spaziali del mondo reale, nonostante la natura sintetica e le dimensioni contenute del dataset. Il codice e i dati sono disponibili all’indirizzo https://github.com/rsoohyun/SpatialBlock.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv