Ricerca
Qwen-Drive-1.0: un primo passo verso un modello fondazionale visivo-linguistico per la guida autonoma
Presentiamo Qwen-Drive-1.0, un primo passo verso un modello fondazionale visivo-linguistico per la guida autonoma. Qwen-Drive-1.0 mantiene l’architettura del modello visivo-linguistico (VLM) preaddest

- arXiv
- 2609.00111
- Pubblicato
- 2026-08-31
- Autori
- Xin Zhou, Zongchuang Zhao, Zhibo Yang, Mingsheng Li, Humen Zhong, Shuai Bai, Du Chu, Ruizhe Chen, Zhaohai Li, Jun Tang, Qiuyue Wang, Mingkun Yang, Jiazhao Zhang, Dayiheng Liu, Dingkang Liang, Xiang Bai
Abstract degli autori
Presentiamo Qwen-Drive-1.0, un primo passo verso un modello fondazionale visivo-linguistico per la guida autonoma. Qwen-Drive-1.0 mantiene l’architettura del modello visivo-linguistico (VLM) preaddestrato e integra percezione 3D, risposta a domande sulle immagini e pianificazione del movimento in un unico sistema. Un modulo esterno di percezione con vista dall’alto (BEV) svolge congiuntamente il rilevamento di oggetti 3D, la previsione dell’occupazione semantica e la segmentazione della mappa BEV. Funge da sonda per verificare quali informazioni 3D siano accessibili dalle rappresentazioni condivise e offre un’interfaccia esplicita e ispezionabile alla struttura 3D della scena. Un Planning Expert usa le rappresentazioni condivise del VLM per generare le traiettorie future del veicolo stesso. Una procedura di addestramento per fasi combina dati di supervisione relativi alla guida con dati visivo-linguistici di uso generale, per acquisire competenze specifiche nella guida e contribuire al tempo stesso a preservare un’ampia capacità di comprensione visiva e di seguire le istruzioni. Gli esperimenti mostrano risultati solidi nella percezione 3D e nella comprensione delle scene di guida, preservando in larga misura le capacità visivo-linguistiche generali. Valutazioni approfondite in configurazioni open-loop, pseudo-closed-loop e closed-loop mostrano inoltre prestazioni altamente competitive nella pianificazione del movimento.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv