Vai al contenuto
AI.info

Ricerca

Strutturare i modelli fondazionali come agenti per il mondo fisico sposta in avanti la frontiera della navigazione su lunghi orizzonti

Gli agenti che operano nel mondo fisico su lunghi orizzonti devono ragionare su obiettivi lontani, fondando al tempo stesso le proprie decisioni su comportamenti affidabili a ciclo chiuso. I modelli f

Strutturare i modelli fondazionali come agenti per il mondo fisico sposta in avanti la frontiera della navigazione su lunghi orizzonti
arXiv
2608.30396
Pubblicato
2026-08-31
Autori
Zixing Lei, Gengze Zhou, Xiong-Hui Chen, Jiazhao Zhang, Yiyang Huang, Hang Yin, Haoqi Yuan, Qi Wu, Weixin Li, Siheng Chen

Abstract degli autori

Gli agenti che operano nel mondo fisico su lunghi orizzonti devono ragionare su obiettivi lontani, fondando al tempo stesso le proprie decisioni su comportamenti affidabili a ciclo chiuso. I modelli fondazionali di oggi presentano queste capacità separatamente: i modelli visione-linguaggio (VLM) deducono le informazioni mancanti e adattano i piani di alto livello, ma sono fragili e inefficienti quando devono ancorare ripetutamente la navigazione al contesto; i modelli fondazionali per la navigazione (NFM), invece, eseguono in modo robusto obiettivi semantici, ma operano in episodi circoscritti, senza un ragionamento persistente a livello di compito. Presentiamo NavMCP, un framework di strutturazione degli agenti che combina un agente VLM dedito al ragionamento con un NFM che funge da esecutore per l’esplorazione su lunghi orizzonti. Il VLM decide quali evidenze cercare, dove cercarle e quando fermarsi, mentre l’NFM traduce ciascun sotto-obiettivo semantico in navigazione a ciclo chiuso. Tre canali strutturano la loro collaborazione: l’intento traduce le esigenze di evidenza in chiamate di navigazione, l’osservazione converte le esecuzioni in evidenze sulle traiettorie ancorate alle fonti e la memoria accumula risultati, evidenze negative e obiettivi irrisolti tra una chiamata e l’altra. Questa struttura trasforma esecuzioni di navigazione isolate in un’interazione incarnata persistente, senza riaddestrare nessuno dei due modelli. Nell’Embodied Question Answering, NavMCP ottiene risultati allo stato dell’arte su HM-EQA, MT-HM3D ed EXPRESS-Bench. A parità di backbone dell’agente e dell’esecutore, supera un’interfaccia episodica di 14,9 punti percentuali su HM-EQA. Su un Unitree Go2, NavMCP raggiunge un tasso di successo del 78,3%, con un vantaggio rispetto al miglior modello di confronto che cresce da 10 a 45 punti all’aumentare dell’orizzonte del compito. Questi risultati dimostrano il potenziale dell’integrazione strutturata di modelli fondazionali complementari in agenti capaci di operare nel mondo fisico su lunghi orizzonti.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv