Vai al contenuto
AI.info

Ricerca

GE-Act 2.0: preaddestramento e aumento di scala di un modello mondo-azione per la manipolazione robotica

I modelli del mondo e delle azioni (WAM) prevedono stati futuri per guidare le azioni dei robot, consentendo di apprendere sia da video privi di etichette relative alle azioni sia da interazioni con a

GE-Act 2.0: preaddestramento e aumento di scala di un modello mondo-azione per la manipolazione robotica
arXiv
2609.05588
Pubblicato
2026-09-04
Autori
AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

Abstract degli autori

I modelli del mondo e delle azioni (WAM) prevedono stati futuri per guidare le azioni dei robot, consentendo di apprendere sia da video privi di etichette relative alle azioni sia da interazioni con azioni etichettate. La maggior parte deriva da generatori video preaddestrati, per cui il preaddestramento e lo scaling dei WAM restano poco esplorati. Presentiamo Genie Envisioner Act 2.0 (GE-Act 2.0), un modello del mondo e delle azioni le cui componenti generative e di azione addestrabili sono tutte inizializzate da zero su dati di manipolazione. Combina un autoencoder orientato al controllo (CoAE), un pianificatore visivo a passo singolo (SVP) e un modello di dinamica inversa (IDM). CoAE conserva le informazioni pertinenti alle azioni e alle istruzioni anche con una compressione spinta, mentre SVP produce uno stato futuro completo in un unico passaggio differenziabile: la pianificazione visiva e la dinamica inversa possono così essere preaddestrate separatamente su dati complementari. Le componenti vengono poi addestrate congiuntamente mediante l’ottimizzazione selettiva allineata alla conoscenza (KASO), che riduce la supervisione non corrispondente selezionando soltanto gli stati futuri previsti giudicati compatibili, sul piano del comportamento, con l’azione registrata. Valutiamo direttamente i checkpoint preaddestrati, senza fine-tuning per i singoli task, su 100 task appartenenti a 20 gruppi di abilità di manipolazione, con scene, sfondi, condizioni di illuminazione ed esemplari di oggetti esclusi dall’addestramento. Portando i dati di co-addestramento da 300 a 30.000 ore, il tasso di successo sale dal 17,1% al 44,1% su G1-OP e dal 13,4% al 31,1% su G2-90D; pur rappresentando meno del 2% dei dati di co-addestramento, G2-90D migliora di 17,7 punti, suggerendo un trasferimento tra diverse configurazioni robotiche. I miglioramenti interessano rispettivamente 19/20 e 18/20 gruppi di abilità, e la copertura specifica di ciascuna abilità è fortemente correlata al successo zero-shot fuori distribuzione (OOD) (Pearson r=0,80; Spearman rho=0,85). Con lo stesso protocollo, il modello associa i riferimenti a oggetti, colori, forme e posizioni agli elementi corrispondenti in almeno il 90% delle prove e segue istruzioni esplicite anche quando contrastano con un comportamento già intrapreso o con un’associazione convenzionale legata alla scena.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv