Vai al contenuto
AI.info

Ricerca

Quando cambiare: estensione affidabile dei chunk di azioni per i modelli visione-linguaggio-azione

I modelli visione-linguaggio-azione (VLA) fungono da policy unificate per la manipolazione robotica, ma il loro elevato costo di inferenza costringe i robot a fermarsi tra un’invocazione della policy

Quando cambiare: estensione affidabile dei chunk di azioni per i modelli visione-linguaggio-azione
arXiv
2610.05719
Pubblicato
2026-10-05
Autori
Seonghoon Yu, Dongwon Kim, HyungRok Jung, Yoonjae Baek, Byung-kwan Lee, Suha Kwak, Jeany Son

Abstract degli autori

I modelli visione-linguaggio-azione (VLA) fungono da policy unificate per la manipolazione robotica, ma il loro elevato costo di inferenza costringe i robot a fermarsi tra un’invocazione della policy e l’altra. Ne deriva un’esecuzione a scatti, che interrompe la fluidità dei movimenti e allunga i tempi di completamento dei compiti. Allungare i chunk di azioni riduce le invocazioni della policy e quindi queste pause, ma prevedere le azioni più avanti nel futuro rende inaffidabile l’esecuzione di chunk lunghi. Per capire da dove derivi questa inaffidabilità, analizziamo gli errori nelle azioni all’interno dei chunk lunghi e scopriamo che si concentrano attorno alle transizioni tra sottoabilità di manipolazione, aumentando bruscamente con la lunghezza dei chunk. Questo indica l’importanza della tempistica delle transizioni, ossia del momento in cui passare da una sottoabilità all’altra all’interno di un chunk. Sulla base di questa osservazione, introduciamo RACE (Reliable Action-Chunk Extension), un framework che prevede la tempistica delle transizioni mediante un passaggio ausiliario di denoising in un solo passo e la usa per condizionare la generazione delle azioni. Apprendendo la tempistica delle transizioni e condizionando su di essa la generazione, RACE riduce gli errori nei passaggi tra sottoabilità e consente di eseguire in modo affidabile chunk di azioni più lunghi. Nei benchmark di simulazione, RACE supera il fine-tuning a parità di lunghezza dei chunk; con chunk 2x più lunghi, supera per tasso di successo i recenti VLA all’avanguardia e quelli efficienti, mentre con chunk 4x più lunghi resta competitivo. Su un robot reale, RACE usa chunk 4x più lunghi, riducendo di circa 5 volte il tempo di inattività causato dall’esecuzione a scatti e ottenendo al contempo un tasso di successo superiore a quello del fine-tuning con chunk della stessa lunghezza. Il codice e una dimostrazione su un robot reale sono disponibili all’indirizzo https://github.com/Seonghoon-Yu/RACE-VLA

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv