Vai al contenuto
AI.info

Ricerca

Pelican-Sim 1.0: un simulatore generale basato su un modello del mondo per l’intelligenza incarnata

In questo rapporto tecnico proponiamo Pelican-Sim 1.0, un simulatore generale basato su un modello del mondo per l’intelligenza incarnata. Il simulatore prevede le osservazioni future a partire dal co

Pelican-Sim 1.0: un simulatore generale basato su un modello del mondo per l’intelligenza incarnata
arXiv
2609.12036
Pubblicato
2026-09-14
Autori
Shilong Zou, Shilin Zhang, Yingji Zhang, Yuhang Huang, Yi Zhang, Zeyuan Ding, Han Dong, Junwei Liao, Yong Dai, Jian Tang, Xiaozhu Ju

Abstract degli autori

In questo rapporto tecnico proponiamo Pelican-Sim 1.0, un simulatore generale basato su un modello del mondo per l’intelligenza incarnata. Il simulatore prevede le osservazioni future a partire dal contesto visivo e dalle azioni del robot, per supportare l’apprendimento e i processi decisionali successivi. Il modello presenta quattro caratteristiche progettuali fondamentali: (1) Rappresentazione unificata delle azioni: uno spazio di valori delle azioni a 28 dimensioni che copre la maggior parte delle configurazioni robotiche più diffuse, consentendo di usare un unico modello con dispositivi eterogenei. (2) Iniezione visiva delle azioni: video delle azioni renderizzati tramite URDF e telecamera collegano le azioni ai pixel, offrendo una controllabilità nettamente migliore tra configurazioni robotiche, scene e compiti diversi (PSNR +0,904 rispetto ad altre soluzioni di fusione prese come riferimento). (3) Mixture-of-experts (MoE) sparsa: i livelli MoE sparsi aumentano la capacità di modellare dinamiche eterogenee e integrano la modalità delle azioni, riducendo al contempo i conflitti tra modalità (FVD -6,530 rispetto all’architettura di base densa). (4) Generazione efficiente dei rollout: l’adattamento causale e la distillazione in pochi passaggi producono un simulatore autoregressivo a quattro passaggi, con una velocità 5,67 volte superiore a quella del modello a 35 passaggi. Grazie a queste scelte, addestriamo il modello su circa un milione di traiettorie reali e simulate e otteniamo notevoli miglioramenti nella controllabilità delle azioni e nella qualità dei video: il PSNR supera quello dei migliori modelli di riferimento valutati di 4,636 su AgiBotWorld Beta, 2,080 su RoboMIND e 10,343 su RoboTwin; su RoboTwin, il punteggio EWMBench DYN adattato aumenta di 0,426. Su questa base, quattro applicazioni successive su RoboTwin ottengono risultati positivi: l’aggiunta di 500 traiettorie generate a 50 dimostrazioni per compito porta il tasso di successo della policy dal 70% al 93%; la valutazione della policy raggiunge una correlazione di Pearson di 0,994 su cinque checkpoint; gli incrementi relativi del tasso di successo arrivano al 47,7% per la selezione delle azioni e al 20,3% per il miglioramento della policy. La generalizzazione qualitativa rispetto a variazioni di traiettoria, scena, oggetto, configurazione robotica e punto di vista ne evidenzia il potenziale come simulatore basato su un modello del mondo di uso generale.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv