The Pulse
Qualcomm illustra l’architettura della NPU Hexagon per l’IA agentica on-device
Un post di Qualcomm OnQ del 10 settembre 2026, firmato da Vinesh Sukumar, descrive una NPU Hexagon di nuova generazione progettata per l’IA agentica on-device, compresi i modelli Mixture-of-Experts e un sistema di memoria condivisa più gran

AI.info Team ·
Qualcomm ha illustrato un’architettura mobile di nuova generazione progettata per eseguire più IA agentica direttamente sugli smartphone. In un post pubblicato su OnQ il 10 settembre 2026, Vinesh Sukumar, vicepresidente della gestione prodotti per l’IA e l’IA generativa di Qualcomm Technologies, ha descritto una nuova NPU Hexagon pensata per carichi di lavoro di IA persistenti, multimodali e a bassa latenza.
Il post non annuncia specifici chip Snapdragon per smartphone. Presenta invece la NPU Hexagon come parte della piattaforma mobile premium di nuova generazione di Qualcomm e mette in evidenza due caratteristiche architetturali: un Element Accelerator progettato per i transformer e un sistema di memoria condivisa più grande.
Perché Qualcomm punta sui modelli mixture-of-experts
La discussione di Qualcomm verte sull’architettura dei modelli, oltre che sulla velocità pura dei processori. L’azienda afferma di collaborare con fornitori di memoria e di modelli su sistemi on-device basati su modelli Mixture-of-Experts, o MoE. In questi sistemi, si selezionano reti esperte specializzate in base all’input, invece di eseguire l’intera rete a ogni passaggio di inferenza.
Un modello MoE da 30 miliardi di parametri può mantenere disponibili decine di miliardi di parametri, attivandone però solo circa 3 miliardi instradati per ogni passaggio di generazione dei token sulla NPU, afferma Qualcomm. L’azienda cita inoltre la gestione degli esperti da memoria flash a memoria e le tecniche di caching come metodi per ridurre le richieste di larghezza di banda della memoria, mantenendo al contempo disponibili su uno smartphone funzionalità tipiche di modelli più grandi.
La distinzione è importante perché un modello denso richiederebbe la partecipazione di una porzione molto più ampia della rete a ogni passaggio di inferenza. L’instradamento MoE può ridurre il calcolo attivo e il trasferimento di memoria necessari per ogni risposta, anche se il risultato pratico dipenderà dal modello, dalla quantizzazione, dalla configurazione della memoria e dall’implementazione software.
Un sistema di memoria più grande per la NPU Hexagon
Secondo Qualcomm, la NPU Hexagon include un sottosistema di memoria condivisa più grande del 50% rispetto alla generazione precedente. La capacità aggiuntiva dovrebbe consentire di mantenere più stato del modello, attivazioni e tensori intermedi vicino al processore, riducendo gli accessi alla memoria esterna del dispositivo.
L’architettura include anche un Element Accelerator progettato per i carichi di lavoro dei transformer. Qualcomm descrive la NPU come una combinazione di questo acceleratore con estensioni scalari, vettoriali e matriciali. Le estensioni scalari supportano la logica decisionale, l’instradamento e l’orchestrazione, mentre le capacità vettoriali e matriciali aiutano a elaborare le operazioni matematiche usate dai modelli di IA generativa.
Il supporto alle precisioni INT2, INT4, INT8, FP8 e FP16 offre agli sviluppatori diverse opzioni per bilanciare la qualità dei modelli, l’uso della memoria, il consumo energetico e le prestazioni. Per i modelli basati su INT4, Qualcomm dichiara che la piattaforma offre prestazioni di prefill fino al 50% superiori, una maggiore velocità di decodifica, una decodifica speculativa migliorata e un numero complessivo più elevato di token al secondo.
Dagli assistenti agli agenti persistenti sullo smartphone
Qualcomm sta progettando l’architettura per sistemi di IA che operano attraverso diverse applicazioni, anziché rispondere soltanto a prompt isolati di chatbot. L’azienda descrive agenti capaci di mantenere il contesto, usare strumenti, selezionare modelli specializzati e gestire attività simultanee.
In questa progettazione, CPU e NPU hanno ruoli complementari. Qualcomm afferma che la CPU può orchestrare carichi di lavoro articolati in più passaggi e tenere pronti i dati, mentre la NPU Hexagon accelera le operazioni dei transformer e mantiene il contesto usato di frequente vicino all’unità di calcolo. Questa suddivisione dovrebbe supportare cicli ripetuti in cui un agente interpreta il contesto, sceglie un’azione, usa uno strumento e torna al modello per la decisione successiva.
L’azienda associa l’esecuzione locale alla tutela della privacy e a una minore dipendenza dai server remoti. Il post di Qualcomm sottolinea inoltre che una maggiore quantità di dati dei modelli, attivazioni e tensori intermedi può restare nella memoria locale del processore, contribuendo a ridurre i ritardi quando gli agenti passano da un’attività all’altra.
Un’architettura di piattaforma, non il lancio di uno smartphone
Il post di Qualcomm del 10 settembre descrive la NPU Hexagon come una base per l’IA agentica on-device, non come l’annuncio del lancio di due piattaforme per smartphone identificate per nome. La fonte non cita Snapdragon 8 Elite Gen 6 né Snapdragon 8 Elite Extreme Gen 6 e non definisce una distinzione tra prodotti standard ed Extreme.
L’attenzione immediata dell’azienda è rivolta all’architettura sottostante: hardware specializzato, memoria locale ampliata, supporto a precisioni flessibili e tecniche di caricamento dei modelli pensate per rendere praticabili sistemi di IA più grandi sui dispositivi mobili. L’esperienza effettiva dipenderà dalla memoria del telefono, dalla progettazione termica, dalla compressione dei modelli e dall’accesso a runtime ottimizzati.