Vai al contenuto
AI.info

Ricerca

InterEvolve: evoluzione in fase di test dei programmi di ricompensa per la locomozione e la manipolazione di robot umanoidi

Studiamo l’evoluzione in fase di test per la locomozione e la manipolazione di robot umanoidi: risolvere compiti per i quali un controller non è mai stato addestrato riutilizzando le abilità di cui gi

InterEvolve: evoluzione in fase di test dei programmi di ricompensa per la locomozione e la manipolazione di robot umanoidi
arXiv
2610.02196
Pubblicato
2026-10-01
Autori
Zhuo Lin, Sirui Xu, Liuyu Bian, Yu-Xiong Wang, Liang-Yan Gui

Abstract degli autori

Studiamo l’evoluzione in fase di test per la locomozione e la manipolazione di robot umanoidi: risolvere compiti per i quali un controller non è mai stato addestrato riutilizzando le abilità di cui già dispone, migliorando sulla base dei propri tentativi e conservando ciò che apprende, senza un nuovo addestramento. L’intuizione alla base del nostro lavoro è che un controller dalle ampie capacità possiede già gran parte delle competenze necessarie per un nuovo compito. Queste competenze diventano accessibili attraverso un’interfaccia tra pianificazione e controllo sufficientemente espressiva da specificare interazioni in più fasi ricche di contatti, ma anche sufficientemente eseguibile e misurabile perché i riscontri dell’esecuzione possano guidare la pianificazione sulla base dell’esperienza. InterEvolve realizza questa interfaccia con due componenti. In primo luogo, sviluppiamo un foundation model comportamentale forward-backward (FB) che tiene conto degli oggetti: i suoi residui relativi agli oggetti, applicati a un prior del corpo mantenuto fisso, trasformano in fase di test una nuova ricompensa relativa al corpo o agli oggetti in un comportamento di locomozione e manipolazione. In secondo luogo, specifichiamo i compiti come programmi di ricompensa: ricompense articolate in fasi, con condizioni di completamento e costanti regolabili. Un agente basato su un modello linguistico di grandi dimensioni (LLM) rivede la struttura del programma nel contesto, attingendo ai riscontri dell’esecuzione e a una libreria di abilità composta da programmi verificati, mentre un ottimizzatore numerico ne regola le costanti. Poiché ogni candidato viene verificato in scenari di simulazione paralleli, il programma esplora nuovi modi di suscitare, riutilizzare e combinare le capacità motorie già presenti nel controller per il compito da svolgere, migliorando così di iterazione in iterazione. Gli esperimenti mostrano che le ricompense progettate da esseri umani lasciano inutilizzata gran parte delle competenze di locomozione e manipolazione del modello FB, mentre i programmi sviluppati da InterEvolve le mettono a frutto, talvolta attraverso strategie nuove. InterEvolve produce inoltre comportamenti per compiti diversi, scene complesse e composizioni su orizzonti temporali lunghi in simulazione; le abilità sviluppate funzionano autonomamente su un Unitree G1 fisico grazie alla percezione egocentrica di bordo.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv