Ricerca
DroneWAM: un modello mondo-azione efficiente per la navigazione visiva dei droni
I modelli mondo-azione permettono agli agenti di navigazione visiva di prevedere come le azioni possibili cambieranno le osservazioni future e di agire in base alle conseguenze previste. Per i droni,

- arXiv
- 2609.33148
- Pubblicato
- 2026-09-27
- Autori
- Liang Yao, Fan Liu, Hongbo Lu, Wei Xu, Jianyu Jiang, Yijun Shen, Chuanyi Zhang, Pai Peng
Abstract degli autori
I modelli mondo-azione permettono agli agenti di navigazione visiva di prevedere come le azioni possibili cambieranno le osservazioni future e di agire in base alle conseguenze previste. Per i droni, questa capacità deve rispettare vincoli stringenti di accuratezza ed efficienza. Presentiamo DroneWAM, un modello mondo-azione efficiente per la navigazione visiva dei droni. DroneWAM adotta un’architettura basata su JEPA per modellare gli stati futuri direttamente nello spazio delle rappresentazioni, evitando il costo della generazione esplicita di immagini future. Un Resampler preaddestrato comprime ulteriormente le rappresentazioni dense prodotte dall’encoder in un numero minore di token latenti, riducendo il calcolo ripetuto a ogni passo immaginato. Introduciamo inoltre un rollout adattivo, in cui un Gate addestrato sulle preferenze regola la profondità della previsione in base alla scena corrente. Per favorire l’apprendimento con movimenti aerei più articolati, realizziamo DroneNav-6D, un dataset simulato per la navigazione visiva con osservazioni RGB sincronizzate, traiettorie di volo a 6-DoF, comandi di controllo e perturbazioni del vento randomizzate. Su DroneNav-6D, DroneWAM ottiene la migliore accuratezza delle traiettorie tra i metodi confrontati. Il rollout adattivo riduce inoltre la profondità media della previsione da 8 a 4,58, migliorando al contempo l’accuratezza delle traiettorie: un risultato che dimostra come il calcolo predittivo possa essere distribuito più efficacemente tra le diverse scene. \href{https://github.com/1e12Leon/DroneWAM}{Codes and data} saranno resi disponibili.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv