Ricerca
Agire con intenzione: distillare l’intento del comportamento per i modelli visione-linguaggio-azione
I modelli visione-linguaggio-azione (VLA) possono trasformare un contesto multimodale in azioni robotiche, ma i loro decoder delle azioni sono ancora addestrati in larga misura tramite imitazione del

- arXiv
- 2608.23478
- Pubblicato
- 2026-08-24
- Autori
- Sangoh Lee, Sangwoo Mo, Wook-Shin Han
Abstract degli autori
I modelli visione-linguaggio-azione (VLA) possono trasformare un contesto multimodale in azioni robotiche, ma i loro decoder delle azioni sono ancora addestrati in larga misura tramite imitazione del comportamento. Questo addestramento indica quale comando motorio è stato dimostrato, ma lascia implicito l’obiettivo locale a cui il comportamento risponde nell’ambito dell’istruzione. La supervisione basata sul futuro arricchisce l’apprendimento delle azioni con fotogrammi, osservazioni latenti, traiettorie o rappresentazioni del movimento, ma questi segnali colgono specifiche realizzazioni di ciò che potrebbe accadere, anziché l’obiettivo semantico comune al comportamento successivo. Proponiamo Intention Distillation (INDI), che distilla l’intento del comportamento nel decoder delle azioni. Durante l’addestramento, un VLM insegnante i cui parametri restano fissi interpreta un segmento dimostrato a partire dall’osservazione corrente, dall’istruzione, da una sintesi sommaria delle azioni e dal video dell’esecuzione corrispondente. A partire dai suoi input standard, il VLA impiegato ricostruisce la rappresentazione multimodale dell’intento così ottenuta in uno strato intermedio del decoder e la usa per organizzare la previsione delle azioni insieme alle rappresentazioni di come il comportamento si svolge e di ciò che consegue. Su SimplerEnv-Bridge, INDI porta GR00T-N1.7 dal 64,3% all’84,7%, mentre su RoboCasa Kitchen porta la baseline controllata GR00T-N1.7 dal 64,1% al 70,3%, con miglioramenti costanti per $π_{0.5}$ su entrambi i benchmark. Nei compiti del mondo reale, INDI aumenta il successo medio dal 62,0% al 68,7%, con miglioramenti fino a 12,0 punti percentuali nei compiti con un orizzonte temporale più lungo. Ulteriori analisi mostrano che il decoder usa la rappresentazione latente ricostruita, che questa coglie l’obiettivo del comportamento e l’avanzamento dell’esecuzione e che organizza le previsioni successive in funzione dell’obiettivo. Questi risultati mostrano che i decoder delle azioni traggono beneficio dal modellare esplicitamente l’obiettivo semantico del comportamento che generano.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv