Ricerca
ZGCM-1: un modello fondazionale completamente aperto ed estremamente efficiente per la matematica e la ricerca agentica
In questo lavoro presentiamo ZGCM-1, un modello fondazionale denso da 7B, completamente aperto e addestrato da zero con un’efficienza estrema nell’uso dei dati, dei sistemi e degli algoritmi. ZGCM-1 s

- arXiv
- 2609.13356
- Pubblicato
- 2026-09-15
- Autori
- Jiyan He, Guang Liang, Hao Liu, Haoxiang Guan, Jinbo Sun, Junyi Guo, Wenjun Feng, Yantai Xie, Yifei Shen, Bin Shao, Chuyang Wei, Kai Chen, Kexin Zhou, Minghang Zhu, Shuxin Zheng, Tie-Yan Liu, Taine Zhao, Wenhui Zhu, Xueyin Xu, Xiaoqing Zhang, Yatao Li, Yuxuan Ren
Abstract degli autori
In questo lavoro presentiamo ZGCM-1, un modello fondazionale denso da 7B, completamente aperto e addestrato da zero con un’efficienza estrema nell’uso dei dati, dei sistemi e degli algoritmi. ZGCM-1 si basa su una premessa fondamentale: i modelli compatti non possono limitarsi a memorizzare passivamente il web aperto, ma possono superare i limiti della propria capacità parametrica combinando un ragionamento interno deliberato con l’uso attivo di strumenti esterni. Per sostenere questo approccio su un contesto di 256K, sviluppiamo una procedura di addestramento aperta, end-to-end e ad alta efficienza: progettazione congiunta di architettura e sistema, con attenzione a finestra scorrevole dotata di gating alternata all’attenzione completa e un ottimizzatore Muon stabile in FP8; curriculum progressivo e mid-training basato su MDP, con ampliamento del contesto attraverso 16K, 64K e 256K e riformulazione delle tracce di interazione come processi decisionali di Markov. Inoltre, definiamo un flusso di lavoro di ricerca e sviluppo nativo per l’IA, in cui sciami di agenti gestiscono autonomamente le operazioni del cluster, la selezione dei dati e rapide valutazioni diagnostiche. Valutazioni approfondite mostrano che ZGCM-1-7B è competitivo nei benchmark generali rispetto ai modelli della famiglia 7B. In diverse suite impegnative di ragionamento matematico e ricerca agentica, resta competitivo con modelli di frontiera più grandi di diversi ordini di grandezza, come Qwen3-235B-A22B e GLM-5.1. Mostriamo inoltre che il nostro approccio al pre-training offre un miglioramento di ~4,2 volte nell’efficienza, misurata in termini di tempo necessario a raggiungere una determinata loss nel pre-training a 16K. Dall’intero ciclo di sviluppo ricaviamo otto risultati empirici utilizzabili nella pratica, che riguardano la scalabilità dell’architettura, la selezione in base alla qualità nell’SFT, la generalizzazione su contesti lunghi e le dinamiche di addestramento congiunto degli agenti. Per favorire la ricerca della comunità, rendiamo open source i pesi del modello relativi alle fasi di pre-training, mid-training e post-training, i checkpoint intermedi, il codice di addestramento, i dati e le procedure di preparazione dei dati per ciascuna fase, nonché i log di W&B.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv