Vai al contenuto
AI.info

Ricerca

ForgetMimic: disapprendimento dei movimenti per il controllo di umanoidi tramite apprendimento per rinforzo

Il controllo degli umanoidi, che sfrutta dimostrazioni umane, ha permesso di ottenere comportamenti locomotori diversificati, agili e naturali tramite l’apprendimento per rinforzo (RL). Sebbene questo

ForgetMimic: disapprendimento dei movimenti per il controllo di umanoidi tramite apprendimento per rinforzo
arXiv
2609.28378
Pubblicato
2026-09-23
Autori
Xukun Luan, Zhongxiang Lei, Chen Gong, Shaowei Li, Yuanguo Bi, Jinyan Liu

Abstract degli autori

Il controllo degli umanoidi, che sfrutta dimostrazioni umane, ha permesso di ottenere comportamenti locomotori diversificati, agili e naturali tramite l’apprendimento per rinforzo (RL). Sebbene questo paradigma abbia prodotto risultati notevoli nel controllo di umanoidi fisici, le modalità per eliminare movimenti specifici dalle politiche apprese sono state esplorate ancora poco. Affrontare il problema è motivato da urgenti esigenze di sicurezza e privacy: è di fondamentale importanza rimuovere movimenti malevoli, avvelenati o non ottimali, nonché quelli protetti da copyright e soggetti al diritto all’oblio previsto da normative come il GDPR. A tal fine, proponiamo {ForgetMimic}, il primo metodo di disapprendimento a livello di movimento progettato specificamente per il controllo di umanoidi nel mondo fisico. L’idea di fondo di ForgetMimic è la seguente: data una politica $π_θ$ addestrata su $N$ movimenti, il nostro metodo ne degrada le prestazioni su un sottoinsieme bersaglio di $K$ movimenti, preservando al contempo l’efficacia sui restanti $N-K$ movimenti. Inoltre, individuiamo e risolviamo due meccanismi chiave dell’addestramento nel controllo robotico che causano il fallimento del disapprendimento. Conduciamo esperimenti approfonditi sui robot umanoidi Unitree G1 e H2 su 12 movimenti, tra cui danza, combattimento, capriole e altri. I risultati sperimentali dimostrano che ForgetMimic elimina efficacemente la memoria dei movimenti designati, mantenendo il normale funzionamento di tutti gli altri.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv