Ricerca
Un framework parallelo su GPU per l’apprendimento per rinforzo multi-task eterogeneo
La simulazione parallela su GPU consente numerose interazioni con i robot, ma i benchmark esistenti raramente combinano questa scala con compiti di manipolazione eterogenei e una valutazione standardi

- arXiv
- 2606.03335
- Pubblicato
- 2026-06-02
- Autori
- Rui Zhang, Qiwei Wu, Zhengyu Zhang, Tao Li, Hongyu Zhou, Xiang Li, Yunrong Guo, Junjie Lai, Renjing Xu, Weihua Zhang
Abstract degli autori
La simulazione parallela su GPU consente numerose interazioni con i robot, ma i benchmark esistenti raramente combinano questa scala con compiti di manipolazione eterogenei e una valutazione standardizzata dell’apprendimento per rinforzo multi-task. Presentiamo Hebero (Heterogeneous Benchmark for Robot Learning), un benchmark parallelo su GPU basato su Isaac Lab che consente di addestrare e valutare in modo efficiente un’unica politica su tutti i 40 compiti eterogenei. Gli esperimenti di scalabilità mostrano che aumentare le repliche parallele per compito migliora il tasso di successo a parità di tempo disponibile. Per favorire l’apprendimento con ricompense sparse e un numero limitato di dimostrazioni, proponiamo Demonstration-Guided Policy Optimization (DGPO), che riutilizza le dimostrazioni per ottenere ricompense dense per il tracciamento e per l’apprendimento asimmetrico della funzione di valore. La sua infrastruttura condivisa consente confronti controllati, nell’ambito di PPO, tra interfacce con le dimostrazioni specifiche per ciascun metodo di apprendimento. Nel framework DGPO introduciamo IW-ABC, che usa un semplice segnale di avanzamento dell’apprendimento per ciascun compito per coordinare l’imitazione comportamentale adattiva (ABC), attenuando la guida fornita dalle dimostrazioni man mano che il compito progredisce, e la ponderazione per importanza (IW), dando maggior peso ai compiti in ritardo negli aggiornamenti di PPO. Con 50 dimostrazioni per compito, IW-ABC raggiunge un tasso medio di successo del 90,1% con input di stato, superando di 7,8 punti percentuali FAMO-ABC, la baseline migliore. La sua controparte visiva raggiunge un tasso medio di successo del 93,5%. Ulteriori esperimenti nel mondo reale mostrano che un’unica politica multi-task addestrata in simulazione è in grado di eseguire con successo quattro compiti su un robot Piper fisico. La pagina del progetto è disponibile all’indirizzo https://hebero-rl.github.io/.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv