Ricerca
La progettazione dell’architettura Qwen3.8-Next: valutazione, efficienza e stabilità dell’addestramento
Descriviamo l’architettura e gli studi di ablazione di Qwen3.8-Flash-Next, un modello mixture-of-experts sparso con 125 miliardi di parametri, di cui 6 miliardi attivati per token, e altri 51 miliardi

- arXiv
- 2608.30320
- Pubblicato
- 2026-08-31
- Autori
- Zihan Qiu, Zekun Wang, Xiao Li, Yanpeng Li, Yang Xu, Yixuan Wang, Huaqing Zhang, Rui Men, Bochao Mao, Chengruidong Zhang, Fan Zhou, Hao Luo, Haofeng Huang, Haoran Lian, Haoyan Huang, Hongqing Chen, Jianwei Zhang, Jing Xu, Junjie Wang, Langshi Chen, Liangyu Wang, Linlang Jiang, Man Yuan, Minmin Sun, Peng Jin, Siqi Zhang, Siyu Wang, Xingzhang Ren, Yakai Wang, Yi Zhang, Yiming Dong, Yizhong Cao, Yubo Ma, Yunfei Mao, Bo Zheng, Dayiheng Liu
Abstract degli autori
Descriviamo l’architettura e gli studi di ablazione di Qwen3.8-Flash-Next, un modello mixture-of-experts sparso con 125 miliardi di parametri, di cui 6 miliardi attivati per token, e altri 51 miliardi di parametri in tabelle di embedding n-gram conservate al di fuori dell’acceleratore. Su quattordici benchmark di pre-addestramento, il modello supera il predecessore 397B-A17B in otto e resta indietro negli altri di non più di 2,6 punti, con 1/3 dei parametri attivati, 1/3 dei token di addestramento e circa 1/9 dei FLOP di addestramento. Il mescolamento dei token usa una combinazione, strato per strato, di Gated DeltaNet (GDN) e attenzione globale, con uno strato di attenzione completa ogni quattro; durante il pre-addestramento continuato, questi strati vengono sostituiti da Qwen Sparse Attention (QSA), che valuta il contesto con granularità a livello di micro-blocchi mediante un indicizzatore compatto e leggero. Il flusso residuo viene ampliato a quattro rami e letto attraverso un gate elemento per elemento, una soluzione che chiamiamo Gated Residual (GR). La capacità viene aumentata al di fuori dell’architettura principale con un unico strato di embedding n-gram, le cui tabelle vengono caricate in anticipo dalla memoria host. Valutiamo ogni modifica candidata lungo tre dimensioni: la perdita insieme ai benchmark downstream; il costo della modifica nelle fasi di addestramento, prefill e decode; e il suo effetto sugli iperparametri ottimali e sulla stabilità dell’addestramento. La perdita e l’accuratezza downstream non si muovono sempre insieme: ampliare il vocabolario n-gram riduce la perdita in modo monotono, mentre l’accuratezza downstream raggiunge un punto di saturazione. L’architettura e l’ottimizzatore Muon, insieme, innalzano il tasso di apprendimento e la dimensione del batch ottimali, rendono superfluo il warmup della dimensione del batch e migliorano notevolmente la stabilità negli stress test. Perdita, benchmark, efficienza e stabilità costituiscono un unico problema di progettazione. Affrontati congiuntamente, portano a una soluzione al tempo stesso più efficiente, più capace e più stabile.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv