Vai al contenuto
AI.info

Ricerca

EmbodiedSWE: agenti di programmazione per la robotica a elevata destrezza su orizzonti temporali lunghi

Studiamo gli agenti di programmazione per la robotica a elevata destrezza su orizzonti temporali lunghi e ci chiediamo se le loro soluzioni possano fornire una supervisione scalabile per apprendere po

EmbodiedSWE: agenti di programmazione per la robotica a elevata destrezza su orizzonti temporali lunghi
arXiv
2609.27308
Pubblicato
2026-09-23
Autori
Haoxiang You, Zeyu Shen, Yilang Liu, Zhicheng Zheng, Lihan Zha, Kashu Yamazaki, Mingtong Zhang, Suning Huang, Jiankai Sun, Qianzhong Chen, Lucy He, Kaiyuan Liu, Haoran Chang, Katerina Fragkiadaki, Dhruv Shah, Mac Schwager, Peter Henderson, Ian Abraham, Canwen Xu

Abstract degli autori

Studiamo gli agenti di programmazione per la robotica a elevata destrezza su orizzonti temporali lunghi e ci chiediamo se le loro soluzioni possano fornire una supervisione scalabile per apprendere politiche generali per i robot. Per verificarlo, sviluppiamo EMBODIEDSWE-BENCH, un benchmark di simulazione per agenti di programmazione che comprende manipolazione con numerosi contatti, oggetti deformabili e attività di lunga durata che richiedono fino a mezz’ora di interazione continua. Rileviamo che gli agenti di programmazione più avanzati sono in grado di risolvere attività complesse di lunga durata e di trasferire soluzioni precedenti tra attività e configurazioni robotiche diverse. Progettiamo anche strumenti di supporto che aiutano gli agenti a risolvere queste attività con maggiore efficacia. Tuttavia, le soluzioni ottenute richiedono una notevole interazione iterativa e sono in genere specifiche per singole istanze di un’attività. Introduciamo quindi EMBODIEDSWE-GEN, che trasforma una singola soluzione prodotta da un agente di programmazione in un ampio insieme di traiettorie diversificate per addestrare un VLA. Le prestazioni del VLA migliorano all’aumentare delle dimostrazioni generate, e la diversificazione assistita dagli agenti migliora la generalizzazione a variazioni delle attività non viste in addestramento. Mostriamo inoltre che un VLA sottoposto a fine-tuning esclusivamente su dimostrazioni simulate generate da agenti di programmazione completa un’attività di lunga durata su un robot reale. Nel complesso, il nostro framework impiega agenti di programmazione per risolvere attività robotiche complesse e trasformare soluzioni verificate in una supervisione scalabile per le politiche robotiche.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv