Vai al contenuto
AI.info

Ricerca

TANGO: navigazione di robot umanoidi in ambienti ingombri con un modello visione-linguaggio-azione per l’intero corpo

Studiamo il problema della navigazione di un robot umanoide in ambienti interni ingombri. A differenza dei metodi convenzionali, che modellano la navigazione come un problema di pianificazione di perc

TANGO: navigazione di robot umanoidi in ambienti ingombri con un modello visione-linguaggio-azione per l’intero corpo
arXiv
2609.09158
Pubblicato
2026-09-08
Autori
Anqi Li, Yuxin Chen, Zhaobo Li, Zhuo Cao, Junli Ren, Masayoshi Tomizuka, Dhruv Shah

Abstract degli autori

Studiamo il problema della navigazione di un robot umanoide in ambienti interni ingombri. A differenza dei metodi convenzionali, che modellano la navigazione come un problema di pianificazione di percorsi in 2D, l’attraversamento di ambienti ingombri da parte di un umanoide richiede un adattamento continuo dell’intero corpo alla geometria dello spazio. Ciò comprende il posizionamento coordinato delle braccia, la regolazione del busto e la modulazione dell’andatura, necessari per muoversi senza collisioni in spazi 3D complessi. Presentiamo TANGO, il primo framework di navigazione basato su visione e linguaggio che coinvolge l’intero corpo per l’attraversamento di ambienti ingombri da parte di umanoidi guidato da istruzioni linguistiche. A partire da un’istruzione in linguaggio naturale e da osservazioni RGB in prima persona, TANGO predice direttamente azioni nello spazio articolare a 29 gradi di libertà per il successivo controllo dell’intero corpo. Addestriamo TANGO interamente in simulazione, generando una varietà di comportamenti di attraversamento senza collisioni mediante pianificazione globale dei percorsi, generazione cinematica dei movimenti dell’intero corpo, modifica dei movimenti in funzione degli ostacoli e tracking basato su RL. Questa procedura fornisce esempi di azioni dinamicamente realizzabili per addestrare politiche di controllo dell’intero corpo condizionate dal linguaggio. In ampi esperimenti di simulazione, TANGO raggiunge prestazioni allo stato dell’arte nella navigazione basata su visione e linguaggio e supera solide baseline modulari nella navigazione di scene difficili che richiedono di superare ostacoli. Infine, impieghiamo TANGO zero-shot su un robot umanoide Unitree G1 e osserviamo un attraversamento affidabile, guidato dal linguaggio, di scene ingombre nel mondo reale, senza addestramento su alcun dato di navigazione del mondo reale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv