The Pulse
Sber pubblica GigaChat 3.5 Reasoning, un modello da 432 miliardi di parametri
Sber ha pubblicato GigaChat 3.5 Reasoning, un modello mixture-of-experts da 432 miliardi di parametri, di cui 28 miliardi attivi. Il modello, i cui pesi sono aperti, usa l’apprendimento per rinforzo online, supporta una finestra di contesto

AI.info Team ·
Sber ha pubblicato GigaChat 3.5 Reasoning il 10 settembre, presentandolo come il primo modello GigaChat addestrato con apprendimento per rinforzo online completo e mettendo a disposizione degli sviluppatori i pesi e il codice per avviarlo. Secondo la documentazione pubblicata dall’azienda, si tratta di un modello mixture-of-experts da 432 miliardi di parametri, di cui 28 miliardi attivi.
«Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL», ha scritto Emil Shakirov, responsabile dell’Alignment di GigaChat, sul blog aziendale di Sber su Habr. La traduzione inglese, qui resa in italiano, è: «Pubblichiamo GigaChat 3.5 Reasoning, il primo modello GigaChat capace di un ragionamento completo, addestrato con l’apprendimento per rinforzo online».
«Мы выпускаем GigaChat 3.5 Reasoning, первую модель GigaChat с полноценным рассуждением, обученную на технологии online RL.»
Emil Shakirov, responsabile dell’Alignment di GigaChat presso Sber
Sei specialisti confluiscono in un unico modello
Secondo Sber, il processo di post-addestramento è partito da un checkpoint ottenuto con fine-tuning supervisionato e si è articolato in sei esperti distinti. Gli specialisti si occupavano di compiti STEM, generazione e modifica convenzionali di codice, agenti che operano sul codice a livello di repository, agenti generalisti, dialogo e rispetto delle istruzioni con output strutturato e compiti su contesti lunghi.
Ogni esperto aveva un proprio sistema di ricompense. Le risposte ai problemi matematici potevano essere confrontate con un risultato noto, il codice poteva essere eseguito, le modifiche ai repository potevano essere testate e gli agenti potevano essere valutati in base allo stato finale di un ambiente. Per il dialogo, Sber ha usato una valutazione comparativa affidata a un modello linguistico nel ruolo di giudice; per i compiti di rispetto delle istruzioni, invece, si è basata su verifiche del formato e dei vincoli.
Il team ha addestrato gli esperti con CISPO, un metodo di ottimizzazione collegato a GRPO. Secondo Sber, CISPO preserva i segnali di apprendimento relativi ai token rari che possono indicare un cambio di direzione durante il ragionamento, per esempio quando si verifica un risultato intermedio o si torna sui propri passi dopo un errore. Dopo cicli separati di apprendimento per rinforzo, i sei esperti sono stati riuniti nel modello pubblicato mediante distillazione on-policy.
Un’architettura ibrida pensata per contesti lunghi
GigaChat 3.5 Reasoning combina Multi-head Latent Attention con livelli di attenzione lineare GatedDeltaNet. Il modello include anche GatedNorm e tre teste di previsione multi-token progettate per accelerare la decodifica speculativa.
La scheda del modello pubblicata indica una lunghezza massima del contesto di 262.000 token. È disponibile un repository FP8 per l’inferenza, mentre un repository BF16 separato è destinato al fine-tuning e alla quantizzazione personalizzata. Entrambi i repository sono pubblicati con licenza MIT su Hugging Face e su una pagina separata per il modello BF16.
Per l’esecuzione del modello, Sber consiglia SGLang con parallelismo dei tensori e degli esperti. Le istruzioni dell’azienda descrivono una configurazione con otto H100 per il modello FP8 e una configurazione a due nodi con 16 GPU per i pesi BF16. La configurazione di esecuzione rende disponibile la traccia del ragionamento in un campo reasoning_content separato e supporta l’analisi delle chiamate di funzione.
Netti miglioramenti rispetto a GigaChat 3.5 Instant
Sber segnala netti miglioramenti rispetto a GigaChat 3.5 Instant in diverse valutazioni interne. Il punteggio su GPQA-Diamond sale da 61,11 a 82,32, quello su AIME 2026 con mean@32 aumenta da 67 a 92 e quello su IFBench con un prompt meno vincolante passa da 43,66 a 77.
Nella tabella delle valutazioni complessive dell’azienda, la scheda del modello colloca GigaChat 3.5 Reasoning vicino a DeepSeek V4 Flash Preview, anche se i suoi risultati non sono sempre migliori. GigaChat ottiene punteggi più alti su IFBench e nell’output strutturato, mentre DeepSeek è in vantaggio in diversi test di programmazione agentica e matematica. Su SWE-bench Verified, GigaChat registra 64,7 contro 78,6 di DeepSeek; su Terminal-Bench 2, i punteggi sono rispettivamente 30,3 e 56,6.
Sber segnala anche un minore impiego di token di ragionamento nei compiti matematici difficili. Nei campioni riportati per AIME 2025, AIME 2026, HMMT e IMOAnswerBench, secondo l’azienda GigaChat 3.5 Reasoning usa il 37% di token di ragionamento in meno rispetto a DeepSeek V4 Flash Preview. Le riduzioni indicate vanno dal 23% su AIME 2026 al 41% su IMOAnswerBench.
L’addestramento ha richiesto più di nove mesi
Secondo la documentazione pubblicata, l’apprendimento per rinforzo online su questa scala è una sfida infrastrutturale tanto quanto una sfida di addestramento del modello. Sber afferma che il progetto ha richiesto più di nove mesi: gli ingegneri hanno lavorato per mantenere allineati i sistemi di addestramento e inferenza in presenza di un meccanismo di selezione degli esperti che può scegliere esperti diversi per lo stesso input.
Il team ha usato il rollout routing replay per conservare le scelte degli esperti effettuate durante l’inferenza e riutilizzarle durante l’addestramento. Secondo Sber, nelle misurazioni interne il metodo ha ridotto la differenza tra i due sistemi all’incirca di un ordine di grandezza. Una pipeline di addestramento asincrona ha inoltre separato i pool di GPU destinati al modello insegnante e ai rollout, raggiungendo una velocità più che doppia, pari a oltre 2,5 volte quella dell’implementazione iniziale.
Dopo che Sber ha adattato un’implementazione del repository Miles per il framework di addestramento Verl, la sincronizzazione dei pesi è scesa da diversi minuti a otto secondi per fase di addestramento. L’azienda afferma inoltre che la previsione multi-token nativa ha aumentato di circa il 30% la velocità di addestramento, mentre l’addestramento FP8 ha prodotto un incremento della velocità compreso tra 1,3 e 2 volte rispetto alla configurazione precedente, senza un calo di qualità misurato rispetto a BF16.
Pesi aperti, ma requisiti elevati per l’esecuzione in locale
Gli utenti possono provare il modello tramite il servizio GigaChat, mentre gli sviluppatori possono scaricarne i pesi ed eseguire l’inferenza in locale. I requisiti hardware sono notevoli: gli esempi forniti da Sber per l’avvio prevedono otto GPU H100 per l’inferenza FP8 oppure una configurazione più grande, a due nodi con 16 GPU, per il checkpoint BF16.
Sber non ha presentato il modello pubblicato come un piccolo modello da eseguire in locale. La sua rilevanza è un’altra: l’azienda pubblica un modello di ragionamento completo con un elevato numero totale di parametri, esperti distinti per ambito durante l’addestramento, supporto all’uso di strumenti, output strutturato e una lunga finestra di contesto. I repository aperti danno ai ricercatori accesso ai pesi e alle modalità di esecuzione, ma nella pratica la distribuzione resta un’operazione su scala da data center.
La pubblicazione è datata 10 settembre 2026. Nell’annuncio Sber afferma di avere in programma un’offerta API per le aziende, mentre i repository pubblici del modello e il servizio GigaChat costituiscono i punti di accesso immediatamente disponibili.