Vai al contenuto
AI.info

The Pulse

PrismML fa stare un modello multimodale da 27 miliardi di parametri in 5,9 GB

PrismML ha rilasciato Bonsai 2 27B, un modello multimodale ternario basato su Qwen3.8 27B. Secondo l’azienda, il modello conserva il 98,2% delle prestazioni aggregate nei benchmark del modello di riferimento, occupando 5,9 GB.

PrismML fa stare un modello multimodale da 27 miliardi di parametri in 5,9 GB

AI.info Team ·

PrismML afferma di aver compresso un modello multimodale da 27 miliardi di parametri in 5,9 GB e ha rilasciato Bonsai 2 27B il 17 settembre come sistema con pesi aperti per l’uso in locale. Secondo l’azienda, il suo modello ternario conserva il 98,2% delle prestazioni aggregate nei benchmark di Qwen3.8 27B, il modello a precisione piena su cui si basa.

Il rilascio affronta un limite hardware ben noto: un modello da 27 miliardi di parametri richiede normalmente molta più memoria di quella disponibile su un comune portatile o dispositivo mobile. Il progetto di PrismML usa pesi rappresentati come −1, 0 o +1, insieme a un fattore di scala FP16 per gruppi, ottenendo quelli che l’azienda definisce 1,76 bit effettivi per peso.

Nell’annuncio tecnico, PrismML presenta il risultato come la seconda generazione della famiglia Bonsai, dopo il rilascio di Bonsai 27B a luglio. Il nuovo modello mantiene l’attenzione sull’inferenza in locale, ma migliora il livello di qualità dichiarato nel confronto con il modello di riferimento a precisione piena.

5,9 GB per un modello da 27 miliardi di parametri

Bonsai 2 27B accetta testo e immagini, supporta una finestra di contesto da 262.000 token ed è rilasciato con licenza Apache 2.0. Secondo PrismML, la rappresentazione a pochi bit è applicata all’intero modello linguistico, anziché essere limitata ad alcuni componenti.

Nella tabella dei benchmark dell’azienda, Bonsai 2 27B ottiene un punteggio complessivo di 83,9, contro 85,4 per Qwen3.8 27B a precisione piena e 83,6 per il precedente modello di riferimento Qwen3.6 27B. I risultati riguardano l’uso autonomo di strumenti, la programmazione, il rispetto delle istruzioni, la conoscenza e il ragionamento, la matematica e la visione.

Le prestazioni variano a seconda della categoria. Nei test combinati di matematica, PrismML riporta un punteggio di 96,57, contro 97,06 per Qwen3.8 27B. Nella programmazione il punteggio è 81,58 contro 82,17 per il modello a precisione piena, mentre nella visione arriva a 78,59 contro 81,64.

Ragionamento e visione arrivano sull’hardware locale

PrismML afferma che Bonsai 2 27B funziona sulle GPU NVIDIA tramite CUDA e sui dispositivi Apple tramite MLX, usando kernel personalizzati a pochi bit. L’azienda riporta una velocità fino a 143 token al secondo su una NVIDIA GeForce RTX 5090 e di 46,8 token al secondo su un M5 Max.

Il rilascio comprende anche dichiarazioni sui consumi energetici. Su una RTX 4090, PrismML riporta un consumo di 0,714 milliwattora per token, che secondo l’azienda è inferiore del 40% a quello di un modello 8B eseguito a precisione piena. I dati provengono dai test dell’azienda e dipendono dall’hardware, dalle versioni del software, dalla lunghezza del prompt, dalle impostazioni del contesto e dalla modalità di generazione.

PrismML propone il modello per agenti di programmazione, sistemi capaci di usare il computer, analisi di documenti privati, debugging multimodale e flussi di lavoro che prevedono chiamate a strumenti. Tra gli esempi dell’azienda ci sono cicli di lavoro di agenti di programmazione e dimostrazioni dell’uso del computer su una RTX 5090, ma l’annuncio non stabilisce come Bonsai 2 si confronti con i sistemi commerciali in test indipendenti su ampia scala.

I dettagli dell’installazione dietro il dato principale

La cifra di 5,9 GB indica le dimensioni del modello citate da PrismML, non necessariamente lo spazio totale su disco richiesto per un’installazione funzionante. Il repository della demo di Bonsai dell’azienda indica che la configurazione predefinita scarica un pacchetto del modello PQ2_0 da 7,8 GB più un proiettore per la visione, mentre componenti facoltativi come Open WebUI e un interprete di codice occupano ulteriore spazio.

Il repository segnala anche un’importante condizione di compatibilità. Bonsai 2 richiede attualmente i file eseguibili della versione derivata di llama.cpp sviluppata da PrismML, perché il modello dipende da una trasformazione Hadamard delle attivazioni che non è ancora stata integrata nel progetto originale. La documentazione avverte che le versioni standard di llama.cpp potrebbero rifiutare alcuni formati di Bonsai 2 o produrre risultati non validi con un altro formato di transizione.

PrismML fornisce versioni GGUF e MLX tramite la propria organizzazione su Hugging Face. Il repository descrive Bonsai 2 come il modello predefinito negli script di configurazione, con supporto per Mac, Linux e Windows e, a seconda della macchina, esecuzione tramite Metal, CUDA, Vulkan, ROCm o CPU.

Le dichiarazioni sulla compressione richiedono ancora test indipendenti

Il dato dichiarato del 98,2% di prestazioni conservate è un valore aggregato relativo alla selezione di benchmark dell’azienda. È utile per confrontare l’obiettivo dichiarato da PrismML con il suo modello di riferimento, ma non significa che ogni attività perda solo l’1,8% di qualità. I punteggi delle singole categorie mostrano divari maggiori nella visione e minori nella matematica e nella programmazione.

Il risultato resta significativo per gli sviluppatori che cercano di mantenere l’inferenza vicina all’utente. Un modello capace di elaborare immagini, gestire contesti lunghi, chiamare strumenti e ragionare in più passaggi può essere difficile da eseguire su hardware di consumo quando i suoi pesi occupano decine di gigabyte. Un modello sotto i 6 GB cambia i requisiti di memoria, anche se il pacchetto necessario per l’esecuzione e i file ausiliari richiedono più spazio.

Bonsai 2 27B è già disponibile, ma le sue possibilità d’impiego pratico dipendono dall’ambiente di esecuzione personalizzato, dal formato di file scelto e dall’hardware utilizzato. I dati pubblicati da PrismML documentano le dichiarazioni dell’azienda sulla compressione e sui benchmark; confronti più ampi determineranno quanto bene funzioni il modello al di fuori di quelle condizioni controllate.

Fonte

Esplora

Altri articoli