Vai al contenuto
AI.info

Ricerca

PhysBrain 1.5: dai modelli visivo-linguistici ai modelli fondazionali per il mondo fisico

Presentiamo PhysBrain 1.5, un modello unificato per comprendere gli ambienti fisici, generare azioni e prevedere stati futuri. Prendendo spunto dal ciclo fisico di osservazione, interazione e cambiame

PhysBrain 1.5: dai modelli visivo-linguistici ai modelli fondazionali per il mondo fisico
arXiv
2609.14973
Pubblicato
2026-09-14
Autori
DeepCybo Team, Yu Bin, Haipeng Cao, Zheng Chang, Kai Chen, Youning Chen, Kailin Deng, Yichao Du, Xiaotong Fu, Haoyang Ge, Yunlong Guo, Chenliu Hao, Jiyan He, Xuguo He, Yakun Hou, Kai Hu, Cong Huang, Tuopusen Huang, Yu Huang, Hong Li, Peize Li, Shijie Lian, Xiaopeng Lin, Yun Lin, Haibao Liu, Haochen Liu, Qiuzhi Liu, Shengcai Liu, Zhiqiang Liu, Tao Luo, Peng Ren, Shuo Ren, Chaoyi Ruan, Zhaolong Shen, Yukun Shi, Qiyuan Su, Yuxuan Tian, Yining Wang, Changti Wu, Hao Wu, Xueyin Xu, Ruoqi Yang, Zhaoyang Yang, Hang Yuan, Zhaoyang Zeng, Hanwen Zhang, Ruimeng Zhang, Yao Zhang, Yibo Zhang, Yuxiang Zhang, Zhirui Zhang, Ziyi Zhang, Zubin Zheng, Zishen Zhuang

Abstract degli autori

Presentiamo PhysBrain 1.5, un modello unificato per comprendere gli ambienti fisici, generare azioni e prevedere stati futuri. Prendendo spunto dal ciclo fisico di osservazione, interazione e cambiamento dell’ambiente, riuniamo queste capacità in un quadro di apprendimento comune. Partendo da un modello visivo-linguistico generale, codifichiamo le risposte linguistiche, il movimento dell’effettore finale e i target visivi densi come sequenze discrete e li ottimizziamo congiuntamente mediante la predizione autoregressiva del token successivo. Nel preaddestramento, la supervisione incarnata proviene interamente da video di interazioni umane: episodi incentrati sul compito associano il contesto semantico e spaziale al movimento ricostruito e alle osservazioni successive. Adattiamo poi il modello mediante fine-tuning supervisionato su una combinazione di dimostrazioni umane, traiettorie robotiche ed esperienza simulata. Su 28 benchmark di comprensione incarnata, il nostro modello 8B ottiene un punteggio medio di 72,5, stabilendo un nuovo stato dell’arte open source e raggiungendo prestazioni pari a quelle di importanti modelli proprietari come GPT-6-Astra e Gemini 3.6 Flash. Ottiene i migliori risultati open source in 14 benchmark, pur mantenendo capacità multimodali generali. Oltre a queste valutazioni della comprensione, esempi qualitativi mostrano la capacità del modello di produrre traiettorie dell’effettore finale e prevedere scene future attraverso output RGB, di profondità e di maschera del robot allineati spazialmente.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv