Vai al contenuto
AI.info

Ricerca

DriveZero: guida end-to-end oltre le dimostrazioni umane

La maggior parte dei sistemi di guida autonoma end-to-end impara imitando i registri di guida umana: il comportamento appreso resta così limitato dalla qualità e dalla varietà dei comportamenti rappre

DriveZero: guida end-to-end oltre le dimostrazioni umane
arXiv
2609.06055
Pubblicato
2026-09-05
Autori
Hao He, Chengcheng Hu, Zirun Su, Heng Zhang, Haisong Liu, Jinke Li, Haochen Tian, Zhenwei Shen, Hongyang Li, Zhichao Li, Yunchen Yang, Bochao Huang, Siyu Zhang, Kuangye Chen, Xiongjie Zhang, Wentao Dai, Hengchen Dai, Siyuan Liu, Zehao Huang, Naiyan Wang

Abstract degli autori

La maggior parte dei sistemi di guida autonoma end-to-end impara imitando i registri di guida umana: il comportamento appreso resta così limitato dalla qualità e dalla varietà dei comportamenti rappresentati nelle traiettorie registrate. Questo rapporto presenta DriveZero, un sistema end-to-end che apprende comportamenti di guida che vanno oltre le dimostrazioni umane. Scompone la guida in un modello di percezione e un modello di azione, preaddestra ciascuno nel modo più adatto e li combina in un unico pianificatore end-to-end. I due modelli richiedono approcci di apprendimento diversi: la percezione deve comprendere il mondo e trae beneficio da dati visivi vasti e diversificati; l’azione deve interagire con il mondo e richiede feedback a ciclo chiuso. Per il modello di azione, introduciamo DriveRL, un framework di apprendimento per rinforzo a ciclo chiuso con agenti misti. Trasforma i registri di guida reale in mondi interattivi, nei quali una policy insegnante con accesso a informazioni privilegiate viene addestrata con PPO mediante rollout a ciclo chiuso. Per il modello di percezione, DriveVFM riunisce diversi modelli fondazionali di visione congelati, tra cui DINOv3, SigLIP2, SAM e Depth Anything V2, in un’unica architettura di base, usando soltanto immagini grezze e senza richiedere annotazioni specifiche per il compito. DriveZero unifica poi i due modelli in un pianificatore che usa soltanto telecamere e apprende dal modello insegnante DriveRL congelato attraverso le traiettorie generate dai suoi rollout. Il modello insegnante, condizionato all’obiettivo, può inoltre essere interrogato con intenti di guida ampliati, fornendo una supervisione diversificata e coerente con l’obiettivo che i dati registrati non possono offrire. Su nuPlan, DriveRL, con una ricerca delle azioni in fase di test guidata dal valore, ottiene un punteggio medio di 93,57 nelle tre suddivisioni della community Val14, Test14-hard e Test14-random, sia in modalità non reattiva sia in modalità reattiva, superando l’esperto Log-Replay in tutte e tre. DriveZero raggiunge prestazioni allo stato dell’arte su NAVSIMv1, NAVSIMv2 e sul benchmark a ciclo chiuso HUGSIM senza alcuna supervisione basata su traiettorie umane.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv