Vai al contenuto
AI.info

Ricerca

SpatialOPSD: auto-distillazione dell’intelligenza spaziale dalle tracce verificate di agenti di programmazione

Gli agenti di programmazione spaziale migliorano significativamente il ragionamento spaziale dei modelli linguistici multimodali di grandi dimensioni (MLLM) usando strumenti esterni per generare tracc

SpatialOPSD: auto-distillazione dell’intelligenza spaziale dalle tracce verificate di agenti di programmazione
arXiv
2610.11366
Pubblicato
2026-10-08
Autori
Rongxue Li, Meng Yang, Yiru Mao, Yongliang Tao, Lulu Hu, Bin Yang, Zhao Xu, Weihua Luo, Bowen Xu

Abstract degli autori

Gli agenti di programmazione spaziale migliorano significativamente il ragionamento spaziale dei modelli linguistici multimodali di grandi dimensioni (MLLM) usando strumenti esterni per generare tracce di esecuzione verificate. Questo approccio comporta però inevitabilmente un costo proibitivo in fase di inferenza e una dipendenza da risorse esterne. In questo articolo esaminiamo se un MLLM possa acquisire internamente questa capacità agentica e operare del tutto senza strumenti. Partiamo da una semplice osservazione: fornire a un MLLM, tramite prompt, tracce di esecuzione riassunte di un agente di programmazione spaziale attiva naturalmente la sua catena di pensiero spaziale interna (Chain-of-Thought, CoT). Su questa base presentiamo SpatialOPSD, un framework di auto-distillazione on-policy che integra il ragionamento spaziale in un MLLM autonomo, trattando le tracce verificate degli agenti come informazioni privilegiate. Per limitare la fuga di informazioni privilegiate durante la distillazione, introduciamo Repetition-Aware Distillation, che combina il mascheramento delle ripetizioni con la regolarizzazione unlikelihood. Esperimenti condotti su diversi benchmark mostrano che SpatialOPSD, addestrato tramite auto-distillazione, raggiunge un’accuratezza media superiore a quella di SFT e GRPO sia sui dataset spaziali sia su quelli OOD, con prestazioni e capacità di generalizzazione migliori.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv