Ricerca
Oltre il mondo ricordato: uno stato di credenza 4D predittivo per la navigazione persistente in mondi in evoluzione
La memoria spaziale persistente consente agli agenti incorporati di orientarsi in ambienti familiari nel corso di visite ripetute. Tuttavia, gli oggetti cercati possono spostarsi senza essere osservat

- arXiv
- 2609.39166
- Pubblicato
- 2026-09-30
- Autori
- Mingjian Gao, Zhaocheng Li, Haoyang Huang, Wenqiao Zhang, Yingjie Niu, Hao Zhou, Chao Li, Juncheng Li, Siliang Tang, Yueting Zhuang
Abstract degli autori
La memoria spaziale persistente consente agli agenti incorporati di orientarsi in ambienti familiari nel corso di visite ripetute. Tuttavia, gli oggetti cercati possono spostarsi senza essere osservati, anche durante la navigazione, rendendo inaffidabili le posizioni ricordate quando l’agente vi arriva. Nonostante i progressi nel recupero delle informazioni dalla memoria e nella previsione degli stati, resta difficile tenere conto della continua evoluzione del mondo non osservato e rivedere le ipotesi in condizioni di visibilità limitata. Studiamo Evolving-World Navigation, in cui gli agenti deducono la posizione degli oggetti cercati da osservazioni intermittenti, ne prevedono lo stato al momento dell’ispezione e rivedono le proprie ipotesi sulla base di evidenze visive. Proponiamo EvolvingNav, che costruisce uno stato di credenza indicizzato nel tempo a partire dalle cronologie 3D degli oggetti corredate di timestamp, mediante un modello strutturato di permanenza e ricollocazione. Lo stato di credenza distingue la permanenza nell’ultima posizione osservata dallo spostamento in posizioni alternative e conserva una quota di probabilità per posizioni esterne all’insieme delle candidate note. Un filtro guidato dagli eventi propaga lo stato di credenza corrente con il passare del tempo, prevede la presenza dell’oggetto cercato nelle posizioni candidate ai rispettivi momenti di ispezione e incorpora nuove evidenze RGB-D. Le osservazioni negative riducono il peso delle ipotesi sulla posizione in base a probabilità di rilevamento calibrate e condizionate dalla visibilità, mentre il tracciamento delle evidenze impedisce di riutilizzare le stesse osservazioni. Un controller visivo-linguistico a parametri fissi, che opera in modalità zero-shot, usa lo stato di credenza aggiornato per scegliere le azioni e riformulare il piano. Introduciamo inoltre EvoWorld-Bench, un benchmark basato su tracce di attività umana, che comprende 54 scene e 803.680 compiti con cambiamenti controllati prima e durante la navigazione. Negli esperimenti in simulazione e con robot reali, EvolvingNav migliora il successo della navigazione e l’efficienza della ricerca rispetto ai metodi di riferimento valutati. Gli esperimenti appaiati mostrano i miglioramenti più netti in presenza di schemi temporali apprendibili, mentre gli studi di ablazione dimostrano l’utilità di preservare l’incertezza e incorporare evidenze che tengano conto della visibilità.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv