Vai al contenuto
AI.info

Ricerca

Grounded Action Model: il grounding 3D come fondamento per la robotica

Le politiche di manipolazione devono sapere quali oggetti sono rilevanti e dove si trovano. Eppure i backbone preaddestrati alla base degli attuali modelli fondazionali per la robotica — dall’uso del

Grounded Action Model: il grounding 3D come fondamento per la robotica
arXiv
2609.23863
Pubblicato
2026-09-20
Autori
Gehao Zhang, Weikai Huang, Shailesh Shailesh, Yiyan Peng, Jiafei Duan, Ranjay Krishna

Abstract degli autori

Le politiche di manipolazione devono sapere quali oggetti sono rilevanti e dove si trovano. Eppure i backbone preaddestrati alla base degli attuali modelli fondazionali per la robotica — dall’uso del linguaggio nei modelli visione-linguaggio-azione (VLA) alla generazione di video nei modelli mondo-azione (WAM) — non richiedono direttamente questo grounding metrico, lasciando che venga appreso implicitamente dalle dimostrazioni robotiche. Proponiamo i Grounded Action Models (GAM), un nuovo paradigma di modelli fondazionali per la robotica basati sul grounding 3D. I GAM possono essere condizionati tramite il linguaggio, punti o prompt sotto forma di riquadri, che vengono prima trasformati in una rappresentazione condivisa, centrata sugli oggetti selezionati. Questa rappresentazione acquisisce caratteristiche visive focalizzate sugli obiettivi e la geometria metrica degli oggetti, integrate con la cronologia degli stati del robot tramite un transformer multi-stream per prevedere segmenti di azioni. Sebbene i GAM possano funzionare autonomamente, possono anche fungere da controller di basso livello controllati da un planner di alto livello tramite le sue diverse modalità di input, consentendo manipolazioni su orizzonti temporali lunghi e dipendenti dalla memoria. Su RoboTwin 2.0, i GAM raggiungono un tasso medio di successo del 55,3% su 50 attività (contro il 52,0% di Spatial Forcing) e del 47,6% con randomizzazione delle scene (contro il 30,4% di Abot-M0), con una policy d’azione addestrata esclusivamente su dimostrazioni in scene pulite. Su LIBERO-PRO, raggiungono un tasso medio di successo allo stato dell’arte del 61% (contro il 53% di $π_{0.5}$) in 16 configurazioni di perturbazione, con i maggiori miglioramenti quando gli obiettivi vengono ricollocati o designati per la prima volta. Su due robot reali, i GAM mantengono 17 successi su 20 in presenza di variazioni visive su uno YAM bimanuale, contro i 4 su 20 di $π_{0.5}$; inoltre, la loro composizione con un planner Molmo2 su un Franka raggiunge il 64,7% di completamento degli step in ID e il 49,8% in OOD nelle attività su orizzonti temporali lunghi e dipendenti dalla memoria.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv