Ricerca
MiMo-V2.6: ampliare l’apprendimento per rinforzo verso l’auto-miglioramento
L’apprendimento per rinforzo (RL) è il paradigma di addestramento centrale per far progredire i grandi modelli fondazionali verso l’auto-miglioramento. Questo rapporto presenta la serie MiMo-V2.6, una
- arXiv
- 2610.11959
- Pubblicato
- 2026-10-08
- Autori
- Xiaomi LLM-Core Team, :, Zongming Qiao, Ziyue Hua, Zirui Ou, Zihao Yue, Zihan Jiang, Zhuo Huang, Zhiyang Chen, Zhixian Zheng, Zhipeng Xu, Zhengrui Ma, Yuyang Hu, Yuhang Dong, Yuechen Zhang, Yudong Wang, Yuanxin Liu, Yixin Yang, Yishuo Cai, Yikai Zhao, Yihan Yan, Yifan Zhang, Yifan Song, Xiyu Wei, Xing Zhang, Xin Zhang, Xiaoqian Liu, Xiaodong Ji, Xiangwei Deng, Xueyu Guo, Wenhan Ma, Weimin Xiong, Weikun Wang, Weiji Zhuang, Shuo Liu, Shuhuai Ren, Shuhao Gu, Shimao Chen, Shijie Cao, Shihua Yu, Shicheng Li, Shengjie Zhou, Shaolei Zhang, Rang Li, Qiying Wang, Qingkai Fang, Qianli Chen, Minzheng Wang, Liwen Wang, Linli Yao, Linghao Zhang, Liangyu Cheng, Liang Zhao, Lei Li, Jinhao Dong, Jinyu Xiang, Jianyu Wei, Jiangshan Duo, Huaqiu Liu, Huanjie Fan, Hongyi Guan, Hongshen Xu, Hao Tian, Hanyu Li, Hailin Zhang, Gang Wang, Fuli Luo, Feng Wei, Dong Zhang, Dawei Zhu, Chiheng Lou, Chenhong He, Chenhao He, Chenghua Liu, Bowen Ye, Bowen Shen, Boshen Xu, Bo Yang, Bingquan Xia, Bangjun Xiao, Baixuan Xu, Zhouxiang Mao, Zhiyang Zhang, Zhixiang Xu, Zhenru Lin, Zhengju Tang, Zhaojun Huang, Yuzhe Weng, Yuxing Xiang, Yuxiao Li, Yuheng Yang, Yuhang Wang, Yuchen Liu, Yuanyuan Tian, Yuanliang Dong, Yu Cheng, Yongzhe He, Yongshun Liang, Yong Wang, Yiyan Wang, Yitian Gong, Yijie Zhang, Yanshu Xin, Xun Zhang, Xingjian Zhao, Wenyu Yang, Wenshan Huang, Wenhao Li, Tingwei Huang, Tianyu Yu, Tianyang Lu, Taoyu Yang, Sinan Du, Shutong Tian, Shulin Du, Shengfan Wang, Shanchuan Fang, Qihao Zhang, Qibin Yang, Qian Yu, Qian Tu, Pengrong Xie, Peipei Wang, Peidian Li, Minkun Guo, Mingchen Shao, Luohan Gao, Lijie Wang, Liang Shi, Kaiqi Chen, Kaiming Liu, Kaifei Wang, Kai Yang, Jinlong Xue, Jiechen Zhang, Jiaxuan Liu, Hongxu An, Hao Peng, Hanglong Lü, Guonan Wang, Feiyu Yang, Fanyu Cao, Fangyue Liu, Fan Cui, Cong Wang, Chun Chen, Chenxu Bai, Chengxuan Zhu, Chenghua Wang, Boyi Zeng
Abstract degli autori
L’apprendimento per rinforzo (RL) è il paradigma di addestramento centrale per far progredire i grandi modelli fondazionali verso l’auto-miglioramento. Questo rapporto presenta la serie MiMo-V2.6, una famiglia di modelli omnimodali che spinge avanti la frontiera delle capacità dei modelli aumentando le risorse di calcolo dedicate all’RL. Prima dell’RL, svolgiamo una fase intermedia di addestramento su un ampio corpus multimodale per offrire un vasto spazio di esplorazione e realizziamo una solida infrastruttura sull’architettura ibrida-SWA preaddestrata, a supporto della successiva espansione. Aumentiamo le risorse di calcolo dedicate all’RL lungo tre dimensioni: (1) batch più grandi e maggiore capacità di elaborazione, con un addestramento asincrono che impiega 1.568 campioni e 2,7-3,7 miliardi di token per passo, con lunghezze di contesto fino a 1 milione di token; (2) ambienti più diversificati e complessi, che spaziano dal codice agli ambiti generale, visivo e della cybersicurezza, con diversi agent harness; e (3) più risorse di calcolo per la valutazione, attraverso una valutazione agentica per gruppi che produce segnali di ricompensa più accurati per i compiti con un orizzonte lungo e orienta il modello verso soluzioni più brevi e più efficienti nell’uso dei token. Per mantenere stabile l’addestramento su larga scala, blocchiamo il router MoE e predisponiamo una difesa a più livelli contro il reward hacking. Realizziamo inoltre un’infrastruttura per l’RL agentico su compiti misti, che comprende una rappresentazione unificata delle traiettorie, un rollout ad alta concorrenza su più framework, piani di controllo e dei dati disaccoppiati e coerenza tra addestramento e inferenza. Rendiamo open source le dinamiche di addestramento, gli ambienti RL e il framework RL per facilitare la riproduzione dei risultati e ulteriori ricerche sull’RL su larga scala e sull’auto-miglioramento dei modelli.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv