Ricerca
Esplorazione sistematica delle capacità di GPT-6 Astra come policy per agenti incarnati
GPT-6 Astra mostra una notevole capacità di generare azioni numeriche per i robot, spingendosi oltre la pianificazione ad alto livello. Per valutarne le capacità come policy di uso generale per agenti

- arXiv
- 2609.38537
- Pubblicato
- 2026-09-29
- Autori
- Galbot Team, Xuchuan Chen, Xiaoqian Cheng, Yu Deng, Lihe Ding, Shaocong Dong, Xiangjun Gao, Haozhe Jia, Zekai Li, Zhoujian Li, Yunrui Lian, Sikai Liang, Chenghuai Lin, Dairu Liu, Jiahang Liu, Qingtao Liu, Yuxuan Ma, Zekun Qi, Jiayi Su, He Wang, Ruochen Xu, Tianyu Xu, Xudong Xu, Zhe Xu, Mi Yan, Siming Yan, Li Yi, Ruixi Yu, Jinlu Zhang, Yintianrun Zhang, Zhikai Zhang, Zhizheng Zhang, Yixin Zheng, Weiyi Zhu
Abstract degli autori
GPT-6 Astra mostra una notevole capacità di generare azioni numeriche per i robot, spingendosi oltre la pianificazione ad alto livello. Per valutarne le capacità come policy di uso generale per agenti incarnati, conduciamo una valutazione approfondita in sei ambiți, esaminando il controllo diretto, la cooperazione con policy apprese e l’adattamento basato sul feedback. Nella manipolazione con pinza, Astra può correggere gli obiettivi del compito e predisporre le condizioni di contatto per la successiva esecuzione della policy; il controllo ibrido con π0.5 ottiene un tasso di successo del 48% sul sottoinsieme valutato di RoboDojo. Nella manipolazione che richiede destrezza, il controllo ibrido ottiene un tasso di successo del 50% in dieci prove DexJoCo guidate dall’esperienza, mentre il controllo diretto degli oggetti all’interno della mano fatica a coordinare i contatti delle dita. Nella manipolazione mobile, il controllo ibrido raggiunge un tasso di successo del 38,7% su RoboCasa365 valutato. Nella navigazione, Astra ottiene i risultati migliori nei nostri confronti locali, con un tasso di successo del 92% nell’esecuzione delle istruzioni su RxR e dell’82% nella ricerca di oggetti su HM3D, sebbene la ricerca comporti notevoli deviazioni dal percorso. Nella locomozione, la generazione di riferimenti di movimento densi rimane inaffidabile: nessuno dei cinque tentativi consecutivi su un unico percorso a ostacoli raggiunge la meta, nonostante i miglioramenti nella stabilità e nell’avanzamento. Nella locomozione e manipolazione umanoide, Astra supera i metodi di riferimento in 13 dei 30 compiti di HumanoidBench con controller dell’intero corpo preaddestrati. Questi risultati rivelano un divario tra decisioni utili per il compito e un controllo fisico affidabile. La latenza dell’inferenza limita ulteriormente il controllo nella pratica: su 50 istanze RoboDojo per ciascuna condizione, il controllo assistito da policy e quello diretto consumano rispettivamente 624,8 milioni e 1,132 miliardi di token. Una prova di locomozione di 30 secondi richiede 250 chiamate al modello, della durata media di 39,86 secondi ciascuna, con la simulazione fisica sospesa durante l’inferenza.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv