Vai al contenuto
AI.info

Ricerca

PhysEvo: Astra può agire, lasciamolo agire

Astra può agire, ma l’affidabilità nella manipolazione dipende dal sistema attraverso cui osserva e controlla il mondo. Presentiamo PhysEvo, un framework per l’auto-miglioramento ricorsivo fisico (RSI

PhysEvo: Astra può agire, lasciamolo agire
arXiv
2610.08995
Pubblicato
2026-10-06
Autori
Wenqing Tian, Zeyu Zhang, Zhaocheng Liu, Fengwei Liu, Qiang Liu, Liang Wang

Abstract degli autori

Astra può agire, ma l’affidabilità nella manipolazione dipende dal sistema attraverso cui osserva e controlla il mondo. Presentiamo PhysEvo, un framework per l’auto-miglioramento ricorsivo fisico (RSI) basato su un unico modello congelato. Un agente esegue compiti robotici; un meta-agente usa le traiettorie risultanti per diagnosticare gli errori, rivedere strumenti e abilità e verificare le correzioni. Il meta-agente può migliorare anche i propri strumenti diagnostici: le revisioni conservate sono quindi utili sia per le azioni successive sia per l’ulteriore auto-miglioramento. Questo processo sviluppa il controllo a livello delle articolazioni, un’osservazione orientata alla ricerca di evidenze e abilità di manipolazione riutilizzabili, senza aggiornare i pesi del modello né addestrare separatamente una strategia d’azione. Su 42 compiti RoboDojo, la valutazione delle versioni conservate per l’impiego in ciascun compito, condotta su configurazioni spaziali non viste in precedenza, dà un punteggio medio su cinque dimensioni di 68,14/100 e un tasso di successo del 62,00%, contro il 47,17% dell’agente Astra di RoboDawn che opera in un solo tentativo, il termine di confronto pubblicato più competitivo tra quelli considerati. Su otto compiti di manipolazione difficili per Astra impiegato direttamente, PhysEvo raggiunge un tasso di successo del 55,00%, contro l’1,25% del termine di confronto con Astra impiegato direttamente. L’impiego su AgileX PiPER del sistema di supporto evoluto in simulazione, accompagnato da ulteriori revisioni delle abilità, produce un punteggio medio di 90,60/100 e un tasso di successo dell’84,00% in 25 prove su cinque compiti nel mondo reale. PhysEvo trasforma le conseguenze delle azioni in cambiamenti persistenti e verificabili nel modo in cui un modello congelato agisce e migliora.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv