Vai al contenuto
AI.info

Ricerca

DreamTrue: un modello del mondo per la robotica fedele alle azioni grazie al post-training controfattuale

Presentiamo DreamTrue, un modello del mondo per la robotica a viste multiple, applicabile a robot con diverse configurazioni, che prevede video fedeli alle azioni e fisicamente plausibili. L’addestram

arXiv
2610.12468
Pubblicato
2026-10-08
Autori
Junyan Li, Ruizhi Li, Yu Liu, Xiangshuo Liu, Mingchao Sun, Hongyu Pan, Mu Xu, Lue Fan, Zhaoxiang Zhang

Abstract degli autori

Presentiamo DreamTrue, un modello del mondo per la robotica a viste multiple, applicabile a robot con diverse configurazioni, che prevede video fedeli alle azioni e fisicamente plausibili. L’addestramento di un modello simile sui dataset robotici esistenti incontra due ostacoli: una calibrazione imprecisa può compromettere l’aderenza alle azioni, mentre la scarsa presenza di interazioni non riuscite può orientare le previsioni verso esiti positivi. Per migliorare l’aderenza alle azioni tra diverse configurazioni robotiche, rappresentiamo le traiettorie delle azioni come condizioni nello spazio dell’immagine e introduciamo una calibrazione geometrica offline per allinearle ai video di destinazione. Per ampliare la gamma di interazioni rappresentate, introduciamo il post-training controfattuale: modifichiamo le traiettorie delle azioni registrate e generiamo video futuri con una gamma più ampia di azioni e configurazioni di contatto. Per ottenere valutazioni su queste previsioni anche in assenza di video futuri reali corrispondenti, creiamo un dataset di video annotati da persone che comprende difetti relativi ai robot, agli oggetti e alle interazioni, e lo usiamo per addestrare un modello di ricompensa per video di interazioni robotiche. I suoi punteggi guidano il post-training tramite apprendimento per rinforzo verso esiti delle interazioni più plausibili dal punto di vista fisico. Su AgiBot, DreamTrue raggiunge risultati allo stato dell’arte nell’aderenza alle azioni e riduce dal 48,12% al 6,25% il tasso di difetti nelle interazioni valutato da persone. In particolare, il nostro modello si classifica primo nella categoria dei modelli del mondo dell’AgiBot World Challenge 2026. La pagina del progetto è disponibile all’indirizzo https://brave-eai.github.io/DreamTrue.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv