Ricerca
Verso VLA in tempo reale: denoising del flusso in due passaggi che tiene conto delle fasi e valutazione a livello di sistema
I modelli di visione-linguaggio-azione (VLA) devono affrontare uno scarto temporale tra l’inferenza a bassa frequenza e l’esecuzione robotica ad alta frequenza. Caratterizziamo questo scarto misurando

- arXiv
- 2609.39822
- Pubblicato
- 2026-09-30
- Autori
- Di Wu, Rongtian Shen, Ping Liu, Yan Shen, Zhenhan Yin, Shun Zuo, Xuhua Chen, He Zheng, Lingfeng Zhang, Jianglin Zhang, Tao Zhang
Abstract degli autori
I modelli di visione-linguaggio-azione (VLA) devono affrontare uno scarto temporale tra l’inferenza a bassa frequenza e l’esecuzione robotica ad alta frequenza. Caratterizziamo questo scarto misurando la latenza end-to-end dell’inferenza del modello e della catena di esecuzione del robot. La ripetizione dei passaggi di denoising di Flow Matching incide notevolmente sul costo dell’inferenza, mentre i ritardi dal lato del robot derivano principalmente dall’acquisizione dei dati percettivi, dalla pianificazione delle comunicazioni e dalla risposta fisica. L’analisi del campo di velocità mostra un’intensità e una direzione relativamente stabili nelle prime fasi dell’integrazione, seguite da correzioni della direzione più marcate in prossimità degli ultimi passaggi. Sulla base di queste differenze tra le fasi, proponiamo un denoising non uniforme in due fasi, che riduce il numero di passaggi da 10 a 2 e il tempo di inferenza del modello da 61,557 ms a 21,956 ms. Sviluppiamo inoltre un’architettura distribuita per VLA in tempo reale, con frequenze indipendenti per l’inferenza, la pubblicazione delle azioni e il controllo del robot, acquisizione modulare delle osservazioni e registrazione della provenienza delle azioni. Usando π0.5 come riferimento, valutiamo sei metodi di esecuzione in tempo reale in un compito fisico di piegatura di capi d’abbigliamento su un orizzonte temporale lungo. Legato ottiene nel complesso i risultati migliori tra i metodi basati sull’addestramento, mentre Temporal Smoothing è il migliore tra quelli che non richiedono addestramento; entrambi conseguono buoni risultati in termini di riuscita del compito, tempo di completamento, continuità delle azioni e regolarità dell’accelerazione. La combinazione del denoising in due passaggi con metodi di esecuzione rappresentativi riduce notevolmente il costo dell’inferenza, a fronte di una lieve riduzione delle prestazioni nel compito. Questi risultati suggeriscono di ottimizzare congiuntamente l’efficienza dell’inferenza del modello e la gestione dei tempi del sistema robotico.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv