Ricerca
Rapporto tecnico su Hunyuan-A13B
Presentiamo Hunyuan-A13B, un modello linguistico open source di grandi dimensioni basato su un’architettura Mixture-of-Experts. Contiene 80 miliardi di parametri complessivi, ma ne attiva solo 13 mili

- arXiv
- 2609.27284
- Pubblicato
- 2026-09-23
- Autori
- Tencent Hunyuan Team, Ao Liu, Botong Zhou, Can Xu, Chayse Zhou, ChenChen Zhang, Chengcheng Xu, Chenhao Wang, Decheng Wu, Dengpeng Wu, Dian Jiao, Dong Du, Dong Wang, Feng Zhang, Fengzong Lian, Guanghui Xu, Guanwei Zhang, Hai Wang, Haipeng Luo, Han Hu, Huilin Xu, Jiajia Wu, Jianchen Zhu, Jianfeng Yan, Jiaqi Zhu, Jihong Zhang, Jinbao Xue, Jun Xia, Junqiang Zheng, Kai Liu, Kai Zhang, Kai Zheng, Kejiao Li, Keyao Wang, Lan Jiang, Lixin Liu, Lulu Wu, Mengyuan Huang, Peijie Yu, Peiqi Wang, Qian Wang, Qianbiao Xiang, Qibin Liu, Qingfeng Sun, Richard Guo, Ruobing Xie, Saiyong Yang, Shaohua Chen, Shihui Hu, Shuai Li, Shuaipeng Li, Shuang Chen, Suncong Zheng, Tao Yang, Tian Zhang, Tinghao Yu, Weidong Han, Weijie Liu, Weijin Zhou, Weikang Wang, Wesleye Chen, Xiao Feng, Xiaoqin Ren, Xingwu Sun, Xiong Kuang, Xuemeng Huang, Xun Cao, Yanfeng Chen, Yang Du, Zhen Yang, Yangyu Tao, Yaping Deng, Yi Shen, Yigeng Hong, Yiqi Chen
Abstract degli autori
Presentiamo Hunyuan-A13B, un modello linguistico open source di grandi dimensioni basato su un’architettura Mixture-of-Experts. Contiene 80 miliardi di parametri complessivi, ma ne attiva solo 13 miliardi durante l’inferenza, bilanciando capacità del modello, efficienza computazionale e costi di implementazione. Il modello è stato preaddestrato su un corpus di 20T token, filtrato con criteri rigorosi e arricchito da una selezione più accurata dei dati STEM, migliorando l’affidabilità fattuale e le capacità di ragionamento. Il fine-tuning supervisionato di alta qualità e l’apprendimento per rinforzo su larga scala ne migliorano ulteriormente le prestazioni complessive. Hunyuan-A13B introduce anche un framework Chain-of-Thought a doppia modalità, che adatta la profondità del ragionamento alla complessità del compito: pensiero rapido per le richieste di routine e pensiero lento per i problemi complessi e articolati in più passaggi. Le valutazioni mostrano prestazioni competitive in matematica, scienze, programmazione, comprensione generale del linguaggio e compiti degli agenti, spesso vicine a quelle di modelli molto più grandi. L’elevato throughput in inferenza lo rende adatto alle applicazioni sensibili alla latenza. Rilasciamo Hunyuan-A13B per sostenere la ricerca aperta e l’implementazione pratica di LLM.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv