Vai al contenuto
AI.info

The Pulse

Hugging Face aggiunge Hy4 da 780B di Tencent a Transformers 5.17.0

Hugging Face Transformers 5.17.0 introduce il supporto per Hy4-Preview di Tencent, un modello mixture-of-experts con 780 miliardi di parametri totali, 49 miliardi attivi per token e una finestra di contesto da 1 milione di token. La version

Hugging Face aggiunge Hy4 da 780B di Tencent a Transformers 5.17.0

AI.info Team ·

780 miliardi di parametri, 49 miliardi attivi per token

Transformers 5.17.0 di Hugging Face introduce il supporto nativo per Hy4-Preview di Tencent, un modello linguistico mixture-of-experts con 780 miliardi di parametri totali. Il modello attiva 49 miliardi di parametri per ogni token, indirizza i token verso otto dei 256 esperti selezionabili e include un esperto condiviso che resta attivo in tutto il modello.

La versione è stata pubblicata il 9 settembre 2026 e offre agli sviluppatori un modo standard per caricare il modello tramite Transformers, senza dover ricorrere soltanto ad ambienti di inferenza specializzati. Le note di rilascio di Hugging Face indicano una finestra di contesto da 1 milione di token, anche se il checkpoint completo non può essere contenuto in un solo acceleratore e richiede il parallelismo dei tensori o degli esperti.

Arthur Zucker, ingegnere di Transformers presso Hugging Face, ha descritto la più ampia quinta generazione in un post su LinkedIn come «l’apice dei miei 3 anni @hugginface: transformers v5». Ha aggiunto: «A tutta la comunità dell’IA: siamo pronti a ospitare ogni singolo modello che riusciate a ideare».

Il post di Zucker precede la versione 5.17.0, ma riassume l’obiettivo dichiarato del progetto: rendere la libreria abbastanza ampia da accogliere modelli che non rientrano nello schema originale dei Transformer.

Hy4 combina attenzione sparsa e quattro flussi residui

Hy4-Preview non è semplicemente un Transformer convenzionale più grande. L’implementazione combina Multi-head Latent Attention, DeepSeek Sparse Attention, attenzione con gating e sink apprendibili e Independent Hyper-Connections.

Multi-head Latent Attention comprime chiavi e valori in una rappresentazione latente di dimensioni ridotte, prima di riespanderli per le teste delle query. DeepSeek Sparse Attention usa un indicizzatore leggero per selezionare le chiavi che ogni query deve esaminare. Nei livelli contrassegnati come «condivisi», Hy4 riutilizza la selezione effettuata dal precedente livello dotato di indicizzatore completo, anziché calcolare un nuovo indice per ogni livello.

Independent Hyper-Connections sostituisce un unico percorso residuo con quattro flussi residui paralleli. I flussi vengono combinati prima di ogni sottolivello e nuovamente distribuiti dopo, cambiando il modo in cui le informazioni attraversano la rete senza modificare l’interfaccia di base del modello, basata soltanto su un decoder.

Le note di rilascio chiariscono anche un limite dell’integrazione iniziale: Transformers non esegue i livelli di predizione di più token di Hy4. I checkpoint pubblicati conservano quei pesi affinché altri ambienti di esecuzione possano usarli per la decodifica speculativa, ma Transformers li ignora quando carica il modello.

Perché il dato di 780 miliardi differisce dalle specifiche da 770 miliardi di Tencent

La scheda del modello di Tencent descrive la struttura principale di Hy4 come un modello da 770 miliardi di parametri. Comprende 78 livelli: il primo usa un blocco feed-forward denso, mentre i restanti 77 usano blocchi mixture-of-experts con 256 esperti selezionabili e un esperto condiviso. La scheda indica separatamente un livello nativo di predizione di più token da 10 miliardi di parametri: è questo che porta il totale ai 780 miliardi citati da Hugging Face.

La distinzione conta per la distribuzione del modello. Il dato di 770 miliardi descrive la struttura principale usata per i normali passaggi in avanti, mentre quello di 780 miliardi include il componente conservato per la decodifica speculativa. Secondo la scheda del modello, ogni token attiva otto esperti selezionabili oltre all’esperto condiviso, mentre le note di rilascio di Transformers riassumono il numero di parametri attivi in 49 miliardi.

Secondo l’annuncio dell’azienda, Tencent ha pubblicato Hy4-Preview con licenza Apache 2.0 il 28 agosto 2026. Il modello è disponibile in una versione completa e in una variante FP8 attraverso i canali di distribuzione dei modelli di Tencent, con indicazioni per l’uso di vLLM e SGLang, oltre che di Transformers.

Transformers 5.17.0 aggiunge altre sei famiglie di modelli

Hy4 è l’aggiunta di maggiori dimensioni in questa versione, ma non è l’unica nuova architettura. La versione 5.17.0 aggiunge anche VibeVoice, un framework per la sintesi vocale di lunga durata che genera audio con più parlanti attraverso un processo di diffusione del token successivo all’interno di una struttura da modello linguistico.

NeoMME introduce encoder multimodali multilingue di H Company, tra cui un modello da 260 milioni di parametri e uno da 800 milioni che elaborano token di testo e porzioni di immagini non elaborate in un unico encoder bidirezionale. La variante Retriever supporta sia il calcolo dei punteggi tramite interazione tardiva sia gli embedding densi per la ricerca di documenti visivi.

Fun-ASR-Nano di Alibaba DAMO Academy aggiunge un modello di riconoscimento vocale da 800 milioni di parametri che supporta cinese, inglese e giapponese, sette dialetti cinesi, 26 accenti regionali, la personalizzazione delle parole chiave e la punteggiatura nativa. Kimi Linear di Moonshot AI aggiunge un’architettura ibrida basata su Kimi Delta Attention, mentre Canary-1B-v2 di NVIDIA è destinato al riconoscimento vocale multilingue e alla traduzione da voce a testo.

La versione aggiunge anche NeuCodec, un codec audio neurale basato sulla quantizzazione scalare finita. Secondo Hugging Face, opera a 50 token al secondo e 0,8 kilobit al secondo quando usa 16 bit per token, con ingresso a 16 kHz e uscita a 24 kHz.

Le modifiche a RoPE per la visione interesseranno le integrazioni personalizzate

Oltre ai nuovi modelli, Transformers 5.17.0 introduce una modifica che interrompe la compatibilità con i sistemi di visione esistenti. Gli embedding rotativi bidimensionali e tridimensionali ora usano un modulo unificato per il calcolo delle frequenze in modeling_rope_utils.py.

Gli sviluppatori di modelli di visione personalizzati che dipendono da una disposizione delle griglie RoPE specifica del livello di attenzione o del modello devono spostare quella logica nell’implementazione centralizzata. La versione comprende anche modifiche alla generazione: evita la sincronizzazione non necessaria degli acceleratori a ogni passaggio di decodifica, impedisce alla generazione di scaricare incondizionatamente file remoti dall’Hub e uniforma l’argomento past_key_values nei modelli AfMoE.

Per chi usa Hy4, la questione immediata non è tanto se Transformers sia in grado di riconoscere l’architettura, quanto quanti acceleratori siano disponibili per eseguirla. La documentazione di Hugging Face raccomanda il parallelismo dei tensori o degli esperti e precisa che il parallelismo degli esperti è limitato all’inferenza, perché l’operazione all-reduce degli esperti selezionabili non prevede un passaggio all’indietro. Il supporto software è ora nella libreria principale; il conto dell’hardware resta a carico del team che distribuisce il modello.

Fonte

Esplora

Altri articoli