Vai al contenuto
AI.info

Ricerca

Spatial-Interactor: apprendere il ragionamento spaziale attraverso l’interazione con il mondo fisico osservabile

Il ragionamento spaziale è essenziale affinché i modelli visione-linguaggio (VLM) comprendano e agiscano nel mondo fisico. Ragionare in ambienti dinamici richiede ai VLM di percepire le transizioni lo

Spatial-Interactor: apprendere il ragionamento spaziale attraverso l’interazione con il mondo fisico osservabile
arXiv
2609.23038
Pubblicato
2026-09-19
Autori
Kaixiang Yao, Xu Wang, Miao Pan, Hu Xiyue, Weishi Wang, Daniel Dahlmeier, Jintao Chen, Yongliang Shen, Xuhong Zhang, Wenqi Zhang

Abstract degli autori

Il ragionamento spaziale è essenziale affinché i modelli visione-linguaggio (VLM) comprendano e agiscano nel mondo fisico. Ragionare in ambienti dinamici richiede ai VLM di percepire le transizioni locali di stato causate dal movimento degli oggetti e dai cambiamenti del punto di vista, e di integrarle lungo traiettorie estese per mantenere aggiornato lo stato spaziale; tuttavia, gli attuali VLM restano limitati in entrambe le capacità. L’addestramento spaziale attuale si concentra soprattutto su domande statiche relative agli attributi degli oggetti e alle relazioni spaziali, offrendo una supervisione diretta limitata sulle transizioni di stato; al contrario, le traiettorie di interazione collegano naturalmente un’osservazione precedente, un’azione e un’osservazione successiva, fornendo una supervisione diretta delle transizioni locali di stato, mentre le traiettorie complete rivelano le dipendenze tra transizioni consecutive. Presentiamo quindi Spatial-Interactor, un framework che addestra i VLM a modellare le transizioni di stato del mondo fisico attraverso l’interazione, organizzando questo processo di apprendimento in un curriculum a tre livelli: L1, transizioni passive dello stato del mondo; L2, transizioni attive dello stato dell’agente; e L3, traiettorie di interazione a lungo orizzonte. Di conseguenza, creiamo il dataset Learning from Spatial Interaction (LSI-108K) a partire da traiettorie di interazione simulate e reali, con compiti allineati all’obiettivo di ciascun livello. La nostra strategia di addestramento in due fasi applica il fine-tuning supervisionato (SFT) a L1 e L2 per modellare le transizioni locali; successivamente, la distillazione on-policy (OPD) utilizza l’autodistillazione privilegiata: un ramo insegnante a cui vengono fornite descrizioni delle transizioni a livello di segmento supervisiona il CoT on-policy dello studente, aiutandolo a imparare a integrare transizioni consecutive lungo le traiettorie estese L3. Gli esperimenti condotti su più VLM e benchmark spaziali mostrano miglioramenti costanti nella modellazione delle transizioni locali e nell’integrazione su orizzonti temporali lunghi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv