Vai al contenuto
AI.info

The Pulse

GPT-6 Astra supera 40 policy robotiche, ma fatica ancora con la precisione

Uno studio pubblicato su arXiv valuta GPT-6 Astra su 42 attività di manipolazione di RoboDojo e rileva un’alta posizione in classifica complessiva, insieme a persistenti difficoltà con la precisione, il controllo dinamico e la coordinazione

GPT-6 Astra supera 40 policy robotiche, ma fatica ancora con la precisione

AI.info Team ·

GPT-6 Astra registra un tasso medio di successo del 22,48% in 2.100 prove di manipolazione robotica, posizionandosi davanti a tutte le policy pubbliche incluse nel confronto di RoboDojo. Il risultato mostra le capacità di un modello linguistico di grandi dimensioni come controller diretto di un robot, ma la valutazione rileva anche che Astra ottiene risultati scarsi nelle attività che richiedono precisione, controllo dinamico o una coordinazione complessa tra le due braccia.

I risultati sono presentati in un paper sottoposto ad arXiv il 21 settembre 2026. Lo studio esamina se un modello linguistico di grandi dimensioni possa agire da policy per la manipolazione robotica senza fine-tuning specifico per le singole attività. In questa configurazione, il modello è responsabile della produzione delle azioni, anziché fungere soltanto da pianificatore di alto livello mentre un’altra policy appresa controlla il robot.

«Rileviamo che Astra presenta un profilo di capacità nettamente polarizzato.»

Wenbo Zhang, l’autore che ha sottoposto il paper, è indicato tra gli autori dello studio.

Astra è in testa nel confronto sul benchmark

I ricercatori valutano tre modelli linguistici su tutte le 42 attività di RoboDojo e confrontano i loro punteggi con quelli di 40 policy pubbliche. Astra segue il protocollo ufficiale del benchmark, che prevede 50 episodi per attività, per un totale di 2.100 prove. Ottiene un punteggio di 28,97 e un tasso medio di successo del 22,48%, posizionandosi davanti a tutte le voci pubbliche incluse nel confronto.

Il risultato complessivo non significa che Astra offra prestazioni costanti in tutte le forme di manipolazione. Il paper descrive le sue capacità come nettamente polarizzate: il modello generalizza bene nelle attività che richiedono comprensione semantica ma non un controllo di alta precisione, mentre incontra difficoltà quando il successo dipende da un’esecuzione fisica accurata.

Il confronto include anche GPT-5.5 e DeepSeek-Flash. GPT-5.5 raggiunge un tasso medio di successo dello 0,88%, mentre DeepSeek-Flash arriva all’1,92%. DeepSeek-Flash viene valutato con 10 episodi per attività, mentre Astra e GPT-5.5 seguono il protocollo ufficiale da 50 episodi. Tutti e tre i modelli utilizzano la stessa post-elaborazione descritta nello studio.

La comprensione semantica è un vantaggio

Le prestazioni migliori di Astra si osservano nelle attività in cui il robot deve interpretare una scena o un’istruzione e generalizzare oltre una routine motoria definita in modo molto specifico. Secondo il paper, il modello ottiene buoni risultati nelle attività che richiedono comprensione semantica, comprese quelle in cui deve rispondere al significato dell’attività anziché affidarsi soltanto a movimenti precisi e ripetuti.

Questo andamento aiuta a spiegare perché Astra possa guidare il confronto complessivo con le policy pubbliche nonostante le sue carenze nel controllo fisico. Un modello può individuare l’oggetto rilevante, capire la manipolazione richiesta e selezionare una sequenza plausibile di azioni, e tuttavia fallire quando il risultato finale dipende da un allineamento, una tempistica o una forza precisi.

Precisione e controllo dinamico restano punti deboli

Lo studio riferisce prestazioni scarse nelle attività che richiedono un controllo di alta precisione, risposte dinamiche o una complessa coordinazione bimanuale. Questi limiti evidenziano la distanza tra le ampie capacità semantiche di Astra e l’affidabilità necessaria per le manipolazioni fisiche più impegnative.

L’abstract del paper non presenta un resoconto delle difficoltà attività per attività, perciò i risultati complessivi non permettono di stabilire come Astra si comporti nelle singole attività del benchmark. Mostrano però che la posizione complessiva del modello in classifica non è uniforme: i successi nelle attività semanticamente impegnative si accompagnano a notevoli difficoltà quando il robot deve mantenere un controllo fisico preciso.

I ricercatori esaminano anche l’uso in-context di dimostrazioni one-shot. Gli esperimenti non mostrano alcun vantaggio complessivo nel fornire una singola dimostrazione del comportamento desiderato. Allo stesso tempo, alcune tracce di interazione mostrano il modello correggere le proprie azioni durante un episodio dopo perturbazioni o risultati inattesi. Queste tracce indicano che tali correzioni possono verificarsi, ma l’abstract non afferma che le dimostrazioni migliorino le prestazioni complessive del modello.

Un risultato complessivo solido, ma con limiti evidenti

Nel complesso, la valutazione presenta GPT-6 Astra come il migliore tra i modelli linguistici testati in questa configurazione di RoboDojo e come una policy che si colloca davanti alle 40 voci pubbliche incluse nel confronto. Il suo tasso medio di successo del 22,48% e il punteggio di 28,97 mostrano che un modello linguistico generalista può produrre comportamenti di manipolazione significativi senza fine-tuning specifico per le singole attività.

Il risultato ha un limite ben definito. Le prestazioni di Astra restano inaffidabili quando le attività richiedono precisione, controllo dinamico o un comportamento coordinato delle due braccia. Il paper considera quindi la valutazione una prima prova del potenziale di un modello generalista per la manipolazione, non la dimostrazione che il controllo basato su modelli linguistici abbia risolto il problema dell’affidabilità nella manipolazione robotica.

Fonte

Esplora

Altri articoli