Ricerca
RoboCoach: i modelli del mondo come allenatori attivi per le abilità robotiche componibili
La manipolazione robotica su orizzonti lunghi riutilizza le stesse abilità in molte composizioni di compiti, ma migliorare queste composizioni con ulteriori dimostrazioni dall’inizio alla fine è costo

- arXiv
- 2609.39685
- Pubblicato
- 2026-09-30
- Autori
- Jiajun Liu, Yifan Chen, Yichao Liu, Jiayi Zhang, Ruoqu Chen, Shaoxuan Xie, Guocai Yao, Mengdi Xu, Sen Cui, Changshui Zhang
Abstract degli autori
La manipolazione robotica su orizzonti lunghi riutilizza le stesse abilità in molte composizioni di compiti, ma migliorare queste composizioni con ulteriori dimostrazioni dall’inizio alla fine è costoso. Un sistema pratico capace di migliorarsi autonomamente deve decidere sia che cosa insegnare in seguito, sia dove applicare quella supervisione. Presentiamo ROBOCOACH, un framework di coaching guidato da un modello del mondo che usa i fallimenti immaginati per orientare le richieste di dimostrazioni e gli aggiornamenti degli esperti. Il suo ciclo Route-Imagine-Diagnose-Improve (RIDI) esegue esperti di abilità riutilizzabili all’interno di COACHWORLD, il nostro modello del mondo condiviso e condizionato dalle azioni, e usa un valutatore dei progressi per registrare il primo sottocompito che non viene completato. I dati aggregati determinano quali dimostrazioni di sottocompiti acquisire e quali adattatori degli esperti aggiornare. In due suite di simulazione e su due piattaforme robotiche reali, il successo immaginato e quello ottenuto nell’impiego delle policy sono correlati su 22 coppie compito-policy (rho = 0,840). Confronti controllati mostrano che il nostro metodo di coaching supera i metodi di riferimento a parità di quantità di dati e di programmi di aggiornamento. Con appena 150 dimostrazioni aggiuntive di sottocompiti, il tasso di successo sale dal 13,3% al 75,0% su Franka e dal 40,0% all’83,8% su AgileX. Gli esperti sottoposti a coaching si trasferiscono anche a quattro composizioni tenute da parte, raggiungendo un tasso di successo medio del 35,0%, contro lo 0% di un metodo di riferimento con policy condivisa aggiornato mediante dimostrazioni acquisite in modo uniforme. Nel complesso, questi risultati mostrano che i modelli del mondo possono fungere da allenatori attivi, trasformando i fallimenti immaginati in una supervisione mirata per migliorare le policy modulari. Pagina del progetto: https://robocoach-ai.github.io/
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv