Vai al contenuto
AI.info

The Pulse

Liquid AI aggiunge la decodifica DSpark a LFM2.5-VL-3B

Un articolo del team di Liquid AI descrive un modello draft sperimentale per velocizzare la decodifica.

Liquid AI aggiunge la decodifica DSpark a LFM2.5-VL-3B

AI.info Team ·

Il 24 settembre 2026, Liquid AI ha rilasciato un modello sperimentale di decodifica speculativa per il suo modello visione-linguaggio LFM2.5-VL-3B. L’aggiunta, chiamata LFM2.5-VL-DSpark, è progettata per far generare testo più velocemente al modello, lasciando al modello target il compito di verificare i token proposti. Liquid AI afferma che il modello draft aggiunge circa 280 milioni di parametri, pari all’8,9% dei 3 miliardi di parametri del modello target.

DSpark genera le proposte; LFM2.5-VL-3B le verifica

La decodifica speculativa usa un modello draft più piccolo per proporre più token alla volta. Il modello target, più grande, verifica questi candidati in un unico passaggio, accettando quelli corrispondenti e fornendo un proprio token quando un candidato non supera la verifica. Questo può ridurre il numero di passaggi costosi nella generazione del testo senza chiedere al modello più piccolo di sostituire quello target.

Per la versione visione-linguaggio, Liquid AI afferma che il modello draft acquisisce gli stati nascosti di livelli selezionati di LFM2.5-VL-3B. Le porzioni dell’immagine e i token di testo vengono proiettati in una rappresentazione condivisa prima di quei livelli, così il modello draft lavora con vettori di stati nascosti della stessa dimensionalità per entrambe le modalità di input. L’algoritmo di inferenza rimane lo stesso dei modelli DSpark testuali dell’azienda.

Il modello draft ha quattro livelli basati solo sull’attenzione. Liquid AI afferma di aver scelto questa architettura dopo aver condotto studi di ablazione con tre, quattro e cinque livelli, e di averla addestrata per 10 epoche su una combinazione di dati di fine-tuning supervisionato visione-linguaggio, ponderati in base ai carichi di lavoro previsti. L’azienda riferisce che il tasso di accettazione è migliorato con l’aggiunta di token di addestramento, prima di raggiungere rendimenti decrescenti. La ripartizione dei componenti indica 193 milioni di parametri per lo stack del decoder, 21 milioni per la proiezione degli stati nascosti, 65,5 milioni per la testa Markov e 6.400 per le normalizzazioni e la testa di confidenza, per un totale di 279,5 milioni.

I miglioramenti di velocità variano in base al dispositivo e all’attività

Liquid AI ha testato il sistema su sei carichi di lavoro visione-linguaggio: domande visive generali, domande visive incentrate sul testo, generazione di didascalie per immagini, domande sui grafici, ragionamento complesso e conversazioni a più turni. Le valutazioni hanno usato una dimensione del blocco DSpark pari a otto e seguito il benchmark MMSpec.

Su un M5 Max con MLX, la decodifica è stata da 2,30× a 3,13× più veloce a seconda dell’attività, mentre la latenza end-to-end è migliorata da 1,56× a 2,62×. Su un M3 Ultra con llama.cpp, i miglioramenti della velocità di decodifica sono andati da 1,57× a 2,14×, mentre quelli end-to-end da 1,30× a 1,77×.

I dati relativi all’H100 nell’articolo sono in conflitto. Nel riepilogo si afferma che i miglioramenti della velocità di decodifica arrivano fino a 2,66×, mentre i risultati dettagliati indicano un intervallo «da 20,4x a 2,66x». L’articolo non spiega la differenza, quindi da quei dati non è possibile ricavare in modo coerente il risultato di decodifica sull’H100. Per la latenza end-to-end sull’H100, i risultati dettagliati riportano miglioramenti da 1,64× a 2,27×.

L’elaborazione delle immagini limita l’accelerazione complessiva

DSpark velocizza la decodifica, non la codifica delle immagini né il prefill del prompt. Un modello visione-linguaggio deve prima elaborare un’immagine tramite il proprio encoder visivo, quindi gestire i token visivi e il prompt di testo. Liquid AI afferma che questi passaggi possono rappresentare una parte considerevole del tempo di risposta totale, in particolare sui dispositivi edge, che hanno una capacità di calcolo inferiore rispetto alle GPU dei datacenter. Questo aiuta a spiegare perché il miglioramento end-to-end possa essere inferiore all’aumento della velocità di decodifica.

Il modello draft è disponibile nei formati Safetensors e GGUF, con supporto per llama.cpp, MLX-VLM e SGLang. Liquid AI segnala che per le integrazioni servono build compatibili. Il modello target verifica ogni token proposto; secondo l’articolo, questo rende esatta la decodifica speculativa: l’output greedy coincide con quello del modello target eseguito da solo. Il risultato è una fase di decodifica più breve, affiancata da un modello draft con 279,5 milioni di parametri, anziché da un encoder visivo più veloce.

Fonte

Esplora

Altri articoli