Vai al contenuto
AI.info

Ricerca

PlannerForge: agenti basati su LLM per testare gli algoritmi di pianificazione del movimento nella guida autonoma mediante scenari

Garantire la sicurezza della guida autonoma è una sfida cruciale. I test basati su scenari sono un processo sistematico usato per convalidare i sistemi di guida autonoma (ADS), ma restano una pipeline

PlannerForge: agenti basati su LLM per testare gli algoritmi di pianificazione del movimento nella guida autonoma mediante scenari
arXiv
2609.08965
Pubblicato
2026-09-08
Autori
Yuan Gao, Sebastian Müller, Mattia Piccinini, Marc Kaufeld, Yuchen Zhang, Finn Rasmus Schäfer, Qunying Song, Johannes Betz

Abstract degli autori

Garantire la sicurezza della guida autonoma è una sfida cruciale. I test basati su scenari sono un processo sistematico usato per convalidare i sistemi di guida autonoma (ADS), ma restano una pipeline modulare frammentata, in cui generazione, recupero e modifica degli scenari, esecuzione degli ADS e analisi dei risultati sono affidati a strumenti separati che interagiscono poco tra loro. Gli agenti basati su modelli linguistici di grandi dimensioni (LLM) hanno mostrato risultati promettenti in sottosistemi degli ADS come percezione, pianificazione e controllo. Tuttavia, nessun lavoro precedente copre l’intera pipeline dei test basati su scenari per gli ADS con un framework unificato di agenti LLM. Presentiamo PlannerForge, un framework di agenti LLM che estende tutte le fasi dei test basati su scenari, dalla generazione degli scenari alla valutazione degli ADS, e ne aggiunge altre due potenziate dagli LLM: il miglioramento degli ADS e il benchmarking degli ADS. Valutiamo PlannerForge con 10 LLM pronti all’uso in tutti i compiti — generazione, selezione, modifica, instradamento ai moduli, test del pianificatore e miglioramento — in 5 condizioni di prompt. I punteggi migliori per ciascun compito vanno da 0,88 a 1,00 e i backend open source da 20-35B eguagliano le API commerciali nella maggior parte dei compiti. Modelli open source come Qwen3.6:35B eguagliano le API commerciali in tre dei cinque compiti. La concatenazione dei moduli dall’inizio alla fine conserva l’83% / 78% delle query iniziali (commerciali / open source). PlannerForge supera Scenario Factory 2.0 (Finkeldei et al., 2025) nella generazione a partire dal linguaggio naturale (193 scenari eseguibili su 200 contro 144) e realizza il 92-96% degli attributi richiesti per città, strade e veicoli. Supera BM25 (Robertson and Zaragoza, 2009) nella selezione al rango 1 (92,0% contro 67,5%) e From-Words-to-Collisions (Gao et al., 2025) nelle modifiche fisicamente valide (>=94% contro 31%). Con N=400, l’ottimizzazione dei costi porta il tasso di successo del pianificatore dal 50,4% al 70,2% e riduce le collisioni dal 19,0% all’8,4%, senza fine-tuning specifico per il dominio.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv