Vai al contenuto
AI.info

The Pulse

Ollama aggiunge DFlash e l’input di immagini al suo motore MLX per Apple

L’annuncio di Ollama del 10 agosto aggiunge l’accelerazione DFlash e l’input di immagini per Muse Glimmer su Apple Silicon.

Ollama aggiunge DFlash e l’input di immagini al suo motore MLX per Apple

AI.info Team ·

L’annuncio di Ollama del 10 agosto 2026 ha aggiunto l’accelerazione DFlash e il supporto all’input di immagini al suo motore MLX su Apple Silicon, presentando il modello Muse Glimmer di Meta. Ollama afferma che DFlash rende Muse Glimmer da 1,5 a 1,8 volte più veloce sui chip Apple. Le istruzioni indicano il modello con tag MLX, muse-glimmer:30b-mlx; il post non annuncia una nuova impostazione predefinita per tutti i modelli o tutte le richieste.

Due novità MLX per Muse Glimmer

Muse Glimmer è un modello multimodale da 30 miliardi di parametri, rilasciato con licenza Apache 2.0 e con una finestra di contesto superiore a 128.000 token, secondo Ollama. L’azienda lo presenta come un modello per carichi di lavoro agentici eseguiti localmente, tra cui strumenti di programmazione e assistenti personali. Può essere avviato dalla CLI di Ollama o usato con applicazioni per agenti di programmazione, tra cui Claude Code, Codex e Pi, oltre che con framework per assistenti personali come OpenClaw e Hermes.

L’opzione specifica per MLX offre DFlash e l’input di immagini. L’encoder di percezione dedicato di Muse Glimmer, da 1,8 miliardi di parametri, permette di comprendere le immagini. Ollama elenca attività come creare un sito web o un’applicazione a partire da un disegno o un mockup, usare screenshot nelle applicazioni che interagiscono con il computer e leggere documenti, ricevute e grafici. Queste funzionalità sono descritte per Muse Glimmer tramite MLX; il post non afferma che il supporto all’input di immagini o la velocità indicata si applichino a tutti i modelli del catalogo Ollama.

Le istruzioni di Ollama mostrano comandi separati per il modello standard e la versione MLX: ollama run muse-glimmer e ollama run muse-glimmer:30b-mlx. Il blog raccomanda il secondo per ottenere prestazioni migliori su Apple Silicon. Aggiunge inoltre che Muse Glimmer supporta livelli di ragionamento regolabili, con le impostazioni low, medium, high e xhigh; il post raccomanda livelli più alti per attività complesse di programmazione e agentiche, e più bassi quando la velocità è più importante.

Il rilascio di MLX è iniziato a marzo

Il 30 marzo 2026 Ollama ha presentato in anteprima la sua esperienza basata su MLX per Apple Silicon. MLX è il framework di machine learning di Apple e Ollama ha dichiarato che l’implementazione usa l’architettura di memoria unificata di Apple. L’anteprima ha evidenziato gli agenti di programmazione e gli assistenti personali come casi d’uso. Per il modello Qwen3.5 presentato, Ollama raccomandava un Mac con più di 32GB di memoria unificata.

Il 29 giugno Ollama ha descritto un miglioramento delle prestazioni di MLX distinto, per Gemma 4: la previsione di più token, o MTP. Nel benchmark Aider polyglot per agenti di programmazione, l’azienda ha riportato una generazione in media quasi del 90% più veloce per Gemma 4 12B in NVFP4 su un M5 Max. Il risultato riguarda il modello, la quantizzazione, l’hardware e il benchmark specificati; non è un’affermazione generale sulla velocità di MLX o di tutti i sistemi Apple Silicon. Ollama ha descritto MTP come un metodo che fa preparare al modello una bozza di diversi token, per poi verificarli insieme, regolando la lunghezza della bozza mentre il modello è in esecuzione.

L’ultima versione indicata è un aggiornamento distinto

Al 25 settembre, la pagina delle release di Ollama su GitHub indicava v0.34.4 come ultima versione; era stata pubblicata il 23 settembre. Le note includono aggiornamenti a llama.cpp, MLX e XGrammar, oltre a una modifica alla selezione della risoluzione delle immagini per Gemma 4 su Apple Silicon. Queste note di rilascio sono distinte dall’annuncio di agosto su Muse Glimmer e non modificano le istruzioni specifiche per il modello contenute in quel post.

I materiali pubblicati da Ollama documentano una sequenza: l’anteprima di MLX a marzo, il lavoro sulle prestazioni di MTP per Gemma 4 a giugno e DFlash più l’input di immagini per Muse Glimmer ad agosto. Per le funzionalità annunciate ad agosto, il comando indicato dall’azienda è ollama run muse-glimmer:30b-mlx.

Fonti

Esplora

Altri articoli