Ricerca
ActionPiece: ripensare la tokenizzazione delle azioni per i modelli autoregressivi visione-linguaggio-azione
I tokenizzatori delle azioni svolgono un ruolo centrale nei modelli autoregressivi visione-linguaggio-azione (VLA): determinano sia gli obiettivi dell’addestramento della policy sia i comandi eseguibi

- arXiv
- 2609.18487
- Pubblicato
- 2026-09-16
- Autori
- Shijie Lian, Bin Yu, Zhaolong Shen, Xiaopeng Lin, Yichao Du, Zhirui Zhang, Laurence T. Yang, Kai Chen
Abstract degli autori
I tokenizzatori delle azioni svolgono un ruolo centrale nei modelli autoregressivi visione-linguaggio-azione (VLA): determinano sia gli obiettivi dell’addestramento della policy sia i comandi eseguibili ricavati dai token predetti. La loro fedeltà viene comunemente valutata con metriche di ricostruzione puntuale, come l’errore quadratico medio (MSE), ma piccoli errori nelle singole azioni non descrivono appieno quanto fedelmente vengano preservati gli adattamenti delle azioni nelle diverse dimostrazioni. Dopo la compressione, azioni simili possono ancora raggrupparsi attorno a un movimento rappresentativo, mentre gli adattamenti necessari nei diversi contesti risultano attenuati, distorti o persino invertiti. Introduciamo la coerenza dell’ordinamento fisico (PRC) per misurare quanto la tokenizzazione preservi, dopo la ricostruzione, gli ordinamenti locali delle distanze fisiche. Valutare le azioni decodificate offre un riferimento comune tra vocabolari di token e architetture di decoder diversi, affiancando all’accuratezza puntuale una misura della fedeltà delle relazioni. Presentiamo inoltre ActionPiece, che preserva le relazioni fisiche tra le azioni mediante una supervisione congiunta dell’apprendimento delle rappresentazioni e della quantizzazione. La preservazione dell’ordinamento fisico supervisiona l’ordine dal più vicino al più lontano nelle distanze tra le rappresentazioni dell’encoder e tra quelle quantizzate, mentre la regolarizzazione della quantizzazione applica lo stesso ordine alle distribuzioni di assegnazione delle parole di codice. Entrambi gli obiettivi integrano la ricostruzione, producendo token discreti delle azioni per l’apprendimento standard di policy autoregressive e per l’esecuzione tramite un decoder congelato. Con la stessa configurazione di addestramento della policy Qwen3-VL-4B, ActionPiece raggiunge il 94,8% su LIBERO e il 68,8% su LIBERO-Plus non visto in precedenza; ulteriori valutazioni registrano il 71,9% su SimplerEnv e il 51,5% nell’insieme dei livelli L0-L2 di VLA-Arena. Gli studi di ablazione dei componenti mostrano che i due obiettivi migliorano congiuntamente la PRC e il tasso di successo della policy, dimostrando il valore della supervisione delle relazioni fisiche per la tokenizzazione delle azioni.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv