Vai al contenuto
AI.info

Ricerca

FastOPD: distillazione on-policy per l’impiego di VLA leggeri

I modelli fondazionali Vision-Language-Action (VLA) sono cresciuti rapidamente in dimensioni per migliorare le prestazioni nella manipolazione e la capacità di generalizzazione, ma questa crescita com

arXiv
2610.02832
Pubblicato
2026-10-02
Autori
Yoojin Oh, Jeongsol Kim, Yeonwoo Seo, Jangho Park, Seonghyun Jin, Sunwoo Park, Youngmin Kim, Youngjun Jun, Kyumin Choi, Jong Chul Ye

Abstract degli autori

I modelli fondazionali Vision-Language-Action (VLA) sono cresciuti rapidamente in dimensioni per migliorare le prestazioni nella manipolazione e la capacità di generalizzazione, ma questa crescita comporta elevati costi computazionali che rendono sempre più difficile il loro impiego nel mondo reale. Gli approcci esistenti affrontano generalmente il problema progettando architetture più piccole o riducendo i passaggi iterativi di rimozione del rumore nelle policy basate sui flussi. In questo lavoro proponiamo FastOPD, un framework per passare da VLA fondazionali a VLA leggeri che consente di impiegare nella pratica VLA su larga scala grazie a un’efficiente distillazione on-policy. Nello specifico, FastOPD adatta una mappa di flusso per la supervisione da parte del modello insegnante su un singolo stato e la combina con un obiettivo di autoconsistenza per costruire un modello studente compatto che apprende la dinamica del modello insegnante. Dimostriamo inoltre sul piano teorico che, minimizzando questo obiettivo, il modello studente distillato può riprodurre una distribuzione paragonabile a quella indotta da un modello insegnante ideale a pochi passaggi. Valutiamo FastOPD su diverse policy fondazionali, in simulazione e in esperimenti nel mondo reale. Su LIBERO, FastOPD conserva l’84% delle prestazioni di $π_{0.5}$ con soli due passaggi di inferenza, riducendo la latenza di inferenza del 78,1% e superando i metodi di riferimento esistenti per la distillazione a pochi passaggi in termini di tasso medio di successo. Con LingBot-VLA come modello insegnante, FastOPD migliora di 15,9 punti percentuali il tasso di successo con un solo passaggio rispetto al modello studente di base su RoboTwin 2.0. Dimostriamo inoltre che è applicabile a un World Action Model (WAM) e impieghiamo su un robot reale un modello studente compatto distillato da MolmoAct2.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv