Ricerca
ShieldVLA: allineamento alla sicurezza consapevole della fattibilità per i modelli visione-linguaggio-azione
I modelli visione-linguaggio-azione (VLA) dimostrano una forte capacità di generalizzazione nella manipolazione robotica e nella navigazione, ma gli attuali metodi di fine-tuning offrono garanzie di s

- arXiv
- 2609.13231
- Pubblicato
- 2026-09-15
- Autori
- Manan Tayal, Akshay Nambi
Abstract degli autori
I modelli visione-linguaggio-azione (VLA) dimostrano una forte capacità di generalizzazione nella manipolazione robotica e nella navigazione, ma gli attuali metodi di fine-tuning offrono garanzie di sicurezza limitate. Gli approcci attuali si basano principalmente sull’ottimizzazione lagrangiana, che impone la sicurezza attraverso penalità morbide sul costo cumulativo atteso, con il risultato, spesso, di violazioni residue dei vincoli o di comportamenti eccessivamente conservativi. Inoltre, apprendere la sicurezza in domini visivi è difficile per via dell’assenza di annotazioni di sicurezza dense per ogni passaggio. Proponiamo ShieldVLA, un framework di fine-tuning allineato alla sicurezza per i modelli VLA basato sulla raggiungibilità di Hamilton-Jacobi (HJ). ShieldVLA apprende direttamente dalle osservazioni visive un’approssimazione senza modello della funzione di valore della raggiungibilità HJ, per stimare la regione operativa sicura. Il critico di sicurezza appreso regola l’ottimizzazione della politica, separando la massimizzazione della ricompensa all’interno delle regioni fattibili dal recupero in prossimità di stati non sicuri, così da evitare compromessi persistenti tra ricompensa e costo. Per rendere scalabile la supervisione negli ambienti visivi, introduciamo punteggi di sicurezza VLM basati su rubriche, che trasformano il feedback semantico sulla sicurezza in obiettivi strutturati per il critico senza richiedere etichette di costo manuali. Su cinque benchmark di navigazione e manipolazione che comprendono più architetture VLA di base, ShieldVLA riduce il costo cumulativo per la sicurezza del 57% in media e migliora il tasso di successo dei compiti di +0,13 rispetto a SafeVLA.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv