The Pulse
Google lancia Gemma 4 per telefoni, Raspberry Pi e PC
Google ha lanciato Gemma 4, una famiglia di modelli aperti progettata per il ragionamento locale, i flussi di lavoro agentici e l’IA multimodale offline. I modelli spaziano dalle versioni E2B ed E4B, pensate per i dispositivi edge, ai siste

AI.info Team ·
«Oggi presentiamo Gemma 4, i nostri modelli aperti più intelligenti di sempre.»
Clement Farabet, vicepresidente della ricerca di Google DeepMind, e Olivier Lacombe, direttore della gestione dei prodotti di Google DeepMind
Google ha rilasciato Gemma 4 il 2 aprile 2026, presentando la famiglia di modelli come una serie di sistemi aperti per il ragionamento avanzato, i flussi di lavoro agentici e l’esecuzione locale. Il rilascio comprende hardware che va dai telefoni Android e dai computer Raspberry Pi alle GPU consumer, alle workstation per sviluppatori e alle infrastrutture cloud.
Gemma 4 è disponibile con licenza Apache 2.0. Google afferma che i modelli sono in grado di gestire la pianificazione in più fasi, le chiamate di funzione, l’output JSON strutturato, la generazione di codice offline, la comprensione di immagini e video e l’input audio nelle due varianti più piccole.
Quattro modelli Gemma 4 per due classi di hardware
Google rilascia Gemma 4 in quattro dimensioni: E2B, E4B, 26B e 31B. Durante l’inferenza, i modelli E2B ed E4B hanno un’impronta effettiva rispettivamente di 2 miliardi e 4 miliardi di parametri, mentre il modello 26B è un sistema Mixture of Experts e il modello 31B usa un’architettura densa.
Le varianti E2B ed E4B sono progettate per dispositivi mobili e hardware edge. Google afferma che supportano l’elaborazione audio e visiva, funzionano completamente offline e offrono un’inferenza con latenza quasi zero su dispositivi come telefoni, sistemi Raspberry Pi e computer NVIDIA Jetson Orin Nano. La finestra di contesto, pensata per l’edge, arriva a 128.000 token.
I modelli più grandi sono destinati a laptop, workstation e schede grafiche consumer. Gemma 4 26B attiva solo 3,8 miliardi dei suoi parametri complessivi durante l’inferenza, una scelta progettuale pensata per ridurre la latenza. I modelli 31B e 26B supportano finestre di contesto fino a 256.000 token e sono pensati per assistenti di programmazione, strumenti di sviluppo e agenti software autonomi.
Google collega Gemma 4 alla ricerca su Gemini 3
Google afferma che Gemma 4 è stato sviluppato sulla base della stessa ricerca e tecnologia di Gemini 3. L’azienda descrive la famiglia come i suoi modelli aperti più capaci e mette in evidenza l’intelligenza per parametro, anziché le dimensioni complessive del modello.
Nei risultati della classifica testuale di Arena AI pubblicati da Google e aggiornati al 1° aprile, il modello 31B si è classificato terzo tra i modelli aperti e il modello 26B sesto. Google afferma inoltre che, in questo confronto, i due modelli hanno superato sistemi 20 volte più grandi. Questi dati sono risultati di benchmark dichiarati dall’azienda, non una valutazione indipendente di ogni impiego locale.
I modelli elaborano nativamente più di 140 lingue. Google elenca inoltre il supporto per immagini a risoluzione variabile e video, la comprensione di grafici, il riconoscimento ottico dei caratteri, l’uso di strumenti e le istruzioni di sistema native. L’input audio è disponibile su E2B ed E4B e offre agli sviluppatori una soluzione più leggera per creare applicazioni abilitate alla voce che non richiedono una connessione al cloud.
I flussi di lavoro agentici arrivano sui dispositivi
Gemma 4 è progettato per fare più che generare risposte in chat. Le sue funzionalità native di chiamata di funzione e output strutturato consentono agli sviluppatori di collegare un modello a strumenti e interfacce di programmazione delle applicazioni, permettendogli di pianificare un’attività ed eseguire azioni tramite integrazioni software.
La documentazione di Google per l’edge presenta i modelli più piccoli come base per agenti locali, in grado di funzionare senza inviare prompt o contenuti multimediali a un servizio remoto. Tra gli usi indicati dall’azienda figurano la generazione di codice offline, l’analisi visiva e le esperienze con agenti integrati nelle app, su dispositivi mobili, desktop e altri dispositivi edge.
Google rende disponibili i modelli tramite Google AI Edge Gallery, Google AI Studio, Hugging Face, Kaggle e Ollama. Il lancio include anche il supporto per strumenti come LiteRT-LM, llama.cpp, MLX, vLLM, LM Studio, Keras, Docker e il software di distribuzione di NVIDIA.
Apache 2.0 lascia aperta la distribuzione commerciale
La licenza Apache 2.0 consente agli sviluppatori di modificare, sottoporre a fine-tuning e distribuire Gemma 4 nel rispetto dei termini della licenza. Google presenta questa formula come un modo per offrire alle organizzazioni il controllo sui propri dati, sulle infrastrutture e sulle distribuzioni dei modelli, compresi i sistemi gestiti in sede anziché tramite un’API ospitata.
Google ha continuato ad ampliare la famiglia dopo il lancio di aprile. Un modello 12B presentato il 3 giugno è stato progettato per i laptop e usa un’architettura multimodale unificata con input audio nativo. Google ha dichiarato che il modello può funzionare localmente con 16GB di memoria usando lo stack software supportato dall’azienda.
Il 5 giugno Google ha aggiunto checkpoint con quantizzazione consapevole dell’addestramento, pensati per ridurre il fabbisogno di memoria su hardware mobile e GPU consumer. L’azienda ha dichiarato che il formato mobile ha ridotto a 1GB l’ingombro in memoria di Gemma 4 E2B, preservando una quota maggiore della qualità del modello rispetto alla compressione standard post-training.
I download dimostrano la domanda di modelli locali
Google ha dichiarato che la famiglia Gemma nel suo complesso aveva superato i 400 milioni di download al momento del lancio di Gemma 4. In un aggiornamento sui risultati di Alphabet pubblicato più avanti nel 2026, l’amministratore delegato Sundar Pichai ha affermato che Gemma 4 aveva superato i 300 milioni di download dal lancio di aprile.
Questo dato sull’adozione non stabilisce quante installazioni siano effettivamente in uso su telefoni o altri dispositivi edge. Mostra però la portata della distribuzione a cui punta Google: una famiglia di modelli disponibile dal laptop usato per lo sviluppo locale fino a un’applicazione mobile, con la stessa base a pesi aperti distribuibile anche tramite i servizi cloud di Google.
Il rilascio di Gemma 4 offre agli sviluppatori la possibilità di scegliere tra l’inferenza nel cloud e modelli in grado di funzionare su hardware sotto il loro controllo. La distinzione pratica ora è nelle dimensioni del modello: E2B ed E4B sono pensati per dispositivi con limitazioni di batteria e memoria, mentre le versioni 12B, 26B e 31B sono destinate a laptop, GPU e workstation, dove contano di più un contesto più ampio e un ragionamento più approfondito.