Vai al contenuto
AI.info

Ricerca

EmbodiedSkills: un framework unificato per orchestrare, addestrare e distribuire agenti VLA

I modelli visione-linguaggio-azione (VLA) traducono direttamente le osservazioni visive e le istruzioni linguistiche in azioni robotiche, ma i compiti a lungo orizzonte richiedono più della previsione

EmbodiedSkills: un framework unificato per orchestrare, addestrare e distribuire agenti VLA
arXiv
2609.01281
Pubblicato
2026-09-01
Autori
Wei Wang, Wenqiao Zhang, Yutong Lin, Yuqian Yuan, Tianwei Lin, Jinhao Mao, Zhenxuan Fan, Mingjian Gao, Yang Dai, Wentong Li, Zheqi Lv, Zheng Dong, Yingjie Niu, Jiaqi Zhu, Jun Xiao, Chao Li, Yueting Zhuang

Abstract degli autori

I modelli visione-linguaggio-azione (VLA) traducono direttamente le osservazioni visive e le istruzioni linguistiche in azioni robotiche, ma i compiti a lungo orizzonte richiedono più della previsione delle azioni. Un agente deve coordinare percezione, pianificazione, esecuzione, verifica dei progressi e recupero mentre lo stato fisico cambia. La previsione di un’azione o la scelta di una skill da parte del modello non garantisce, di per sé, che l’operazione proposta sia valida nello stato attuale né che il suo esito venga verificato. Proponiamo EmbodiedSkills, un framework unificato che tratta ogni scelta di una skill come una proposta di esecuzione: il sistema ne controlla i prerequisiti prima di eseguirla e ne verifica l’esito in seguito. Un’interfaccia condivisa per le skill eseguibili collega la selezione delle skill ad alto livello, l’esecuzione VLA di basso livello entro limiti definiti e la verifica successiva all’azione in un unico ciclo dell’agente. Poiché l’interfaccia rimane invariata, le policy VLA di basso livello possono essere sostituite o adattate senza modificare il ciclo dell’agente. L’interfaccia registra inoltre gli eventi di pianificazione, esecuzione, verifica e recupero sotto forma di traiettorie strutturate, che forniscono dati per l’addestramento dei singoli componenti e possono supportare un adattamento online facoltativo quando è disponibile un feedback interattivo. Implementiamo EmbodiedSkills con Qwen3-VL e OpenPI/pi0.5 su RoboTwin 2.0 e LIBERO. Le policy VLA di basso livello adattate ai compiti raggiungono un tasso medio di successo dell’86,20% su 50 compiti di RoboTwin 2.0 e del 97,40% sulle quattro suite di LIBERO. Questi risultati attestano le prestazioni nell’esecuzione delle policy VLA di basso livello adattate ai compiti impiegate in EmbodiedSkills. Su quattro compiti di RMBench che richiedono memoria, lo stesso approccio all’esecuzione adattato ai compiti raggiunge un successo medio del 12,5%. Il framework fornisce un livello dell’agente addestrabile e ispezionabile per trasformare queste policy in sistemi incarnati a ciclo chiuso.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv