Ricerca
SpatialSpeak: ricostruzione nativa per le domande e risposte con contesto locale e globale per il ragionamento spaziale a catena di pensiero
I modelli visivo-linguistici (VLM) possono trarre beneficio da conoscenze geometriche a priori nel ragionamento spaziale basato su più viste. Tuttavia, l’addestramento basato sulle sole risposte non s

- arXiv
- 2609.33616
- Pubblicato
- 2026-09-27
- Autori
- Yang Cao, Jiaxin Zhang, Dave Zhenyu Chen, Yingji Zhong, Ruiyuan Gao, Lanqing Hong, Dan Xu
Abstract degli autori
I modelli visivo-linguistici (VLM) possono trarre beneficio da conoscenze geometriche a priori nel ragionamento spaziale basato su più viste. Tuttavia, l’addestramento basato sulle sole risposte non supervisiona direttamente le stime geometriche intermedie né il loro uso per ricavare risposte spaziali quantitative. Ipotizziamo che la supervisione del ragionamento spaziale a catena di pensiero (CoT) diventi più efficace quando il VLM apprende prima, congiuntamente, informazioni complementari sulla geometria locale e sul contesto globale della scena attraverso la ricostruzione da più viste. Presentiamo SpatialSpeak, un framework in due fasi che collega il pretraining della ricostruzione nativa per le domande e risposte all’apprendimento del CoT spaziale. Nella fase I, QA-Native Reconstruction Pretraining (QA-RP) combina quesiti 3D su punti contrassegnati, per la geometria locale dettagliata, con quesiti sui centri degli oggetti, per il contesto globale della scena nelle diverse viste. Entrambi i compiti sono formulati come domande e risposte testuali, così che la stima geometrica e il successivo ragionamento condividano la stessa interfaccia di output autoregressiva. Nella fase II, il CoT spaziale con Visual Compensation (CoT-VC) addestra il modello a esprimere stime geometriche pertinenti alla domanda e a usarle per ricavare le risposte; la valutazione dell’affidabilità e la compensazione visiva contribuiscono a perfezionare le risposte quando necessario. Su ReVSI, QA-RP porta il miglioramento ottenuto con CoT-VC da 2,6 a 6,9 punti, e gli studi di ablazione mostrano che la supervisione della ricostruzione sia locale sia globale è utile. SpatialSpeak ottiene risultati allo stato dell’arte su ReVSI, VSI-Bench e SPAR-Bench, con un punteggio di 62,8 su ReVSI che supera di 8,7 punti il migliore tra i sistemi di riferimento confrontati.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv