Vai al contenuto
AI.info

Ricerca

Kinematic MeanFlow: una politica per generare azioni in un solo passaggio nei modelli fondazionali per la robotica

In questo articolo studiamo come ottenere la generazione di azioni in un solo passaggio nei modelli fondazionali per la robotica (RFMs), con l’obiettivo di superare l’elevata latenza di inferenza del

Kinematic MeanFlow: una politica per generare azioni in un solo passaggio nei modelli fondazionali per la robotica
arXiv
2610.00864
Pubblicato
2026-10-01
Autori
Jiawei Fan, Sifeng Wang, Yuqing Hou, Anbang Yao

Abstract degli autori

In questo articolo studiamo come ottenere la generazione di azioni in un solo passaggio nei modelli fondazionali per la robotica (RFMs), con l’obiettivo di superare l’elevata latenza di inferenza del flow matching a più passaggi. MeanFlow offre un quadro promettente a questo scopo, ma la sua applicazione diretta provoca un crollo delle prestazioni. Scopriamo che ciò dipende da due dinamiche peculiari del campo delle velocità degli RFMs: (1) l’«accelerazione locale» rimane stabile nelle fasi iniziali, ma aumenta bruscamente verso la fine del processo di denoising; (2) la dispersione dei suoi moduli tra i campioni cresce man mano che il denoising procede. Per affrontare questi problemi, introduciamo Kinematic MeanFlow (K-MF), una nuova politica per generare azioni in un solo passaggio, pensata per gli RFMs. Nello specifico, sulla base di un’identità cinematica, K-MF scompone il termine di derivata temporale nella formulazione di MeanFlow in due termini relativi a sottointervalli separati da un punto intermedio. Questa formulazione consente ai due termini di cogliere, rispettivamente, le dinamiche del denoising nelle fasi iniziali e finali, attenuando al contempo l’amplificazione degli errori nel corso del processo. Di conseguenza, K-MF permette agli RFMs di generare azioni in un solo passaggio in diversi compiti, sia con l’addestramento da zero sia con il fine-tuning, superando le prestazioni del flow matching a più passaggi nella maggior parte delle configurazioni. Quanto all’efficienza dell’inferenza, K-MF riduce la latenza della testa per le azioni di GR00T-N1.6 dal 67,5% al 74,4% su L40 e Jetson Orin nelle modalità eager e compilata, con riduzioni della latenza end-to-end dal 30,3% al 54,9%. Il codice sarà disponibile all’indirizzo https://github.com/IntelChina-AI/K-MF.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv