Vai al contenuto
AI.info

Ricerca

Dynin-Robotics: modello omnimodale unificato a diffusione visione-linguaggio-azione

La previsione degli obiettivi visivi e della dinamica può fornire alle politiche robotiche condizionate dal linguaggio sia un risultato da raggiungere sia una rappresentazione dei cambiamenti della sc

Dynin-Robotics: modello omnimodale unificato a diffusione visione-linguaggio-azione
arXiv
2609.13053
Pubblicato
2026-09-11
Autori
Hoeun Lee, Jaeik Kim, Jusang Oh, Jinhyeok Kim, Geon Choi, Hyeonggeun Kim, Jaeyoung Do

Abstract degli autori

La previsione degli obiettivi visivi e della dinamica può fornire alle politiche robotiche condizionate dal linguaggio sia un risultato da raggiungere sia una rappresentazione dei cambiamenti della scena che dipendono dalle azioni. Integriamo queste previsioni nella generazione e nella selezione delle azioni attraverso un modello condiviso delle traiettorie. Dynin-Robotics realizza questo approccio su Dynin-Omni, un’architettura di base omnimodale a diffusione mascherata, rappresentando linguaggio, osservazioni visive, obiettivi e azioni come token discreti. Variando il condizionamento e i segmenti da predire, lo stesso modello apprende a prevedere le azioni, l’osservazione successiva condizionata dall’azione e lo stato finale dell’obiettivo, nonché a ricostruire le istruzioni a partire dalle traiettorie. Queste modalità consentono lo scaling in fase di test attraverso la previsione degli obiettivi, la valutazione delle azioni candidate e il perfezionamento congiunto delle previsioni delle azioni e degli stati futuri. Preaddestriamo il modello in modo continuo su circa 1,33 milioni di traiettorie provenienti da 48 dataset di Open X-Embodiment e lo adattiamo separatamente ai domini applicativi successivi. In due attività di VLABench, il preaddestramento robotico migliora l’adattamento con un budget fisso di passi nella Stage-2, mentre la combinazione completa degli obiettivi migliora il tasso di successo con istruzioni modificate rispetto al post-training Policy-only, usando lo stesso decoder accoppiato. Combinare la guida fornita dagli obiettivi con la rimozione congiunta del rumore dalle previsioni delle azioni e degli stati successivi migliora ulteriormente il tasso di successo con istruzioni modificate rispetto alla decodifica delle sole azioni; il beneficio dipende da come vengono combinate le previsioni. Dynin-Robotics ottiene prestazioni competitive su LIBERO e su LIBERO-Plus in modalità zero-shot, insieme a un tasso medio di successo del 78,4% in quattro condizioni di manipolazione con un robot Franka Research 3. Un’implementazione ottimizzata con elaborazione parallela a blocchi accelera la decodifica delle azioni da parte del modello fino a 29,2 volte rispetto all’implementazione di base nella configurazione di profilazione descritta. Questi risultati indicano che la modellazione condivisa delle traiettorie è un’interfaccia comune per apprendere obiettivi robotici complementari e combinare le relative previsioni durante il controllo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv