The Pulse
Linkup lancia il modello di retrieval SPARSEUP da 149 milioni di parametri
Linkup Research ha reso open source SPARSEUP, un modello di embedding sparso da 149 milioni di parametri con licenza Apache 2.0. Il modello ottiene un nDCG@10 di 56,4 su BEIR-13 e raggiunge un recall superiore al 97% in circa 380 microsecon

AI.info Team ·
Linkup Research ha rilasciato SPARSEUP il 17 settembre, presentandolo come il suo primo modello open source: un sistema di retrieval sparso da 149 milioni di parametri basato su ModernBERT e distribuito con licenza Apache 2.0. L’azienda dichiara un punteggio medio di 56,4 nDCG@10 su BEIR-13 e lo definisce il miglior encoder sparso pubblico basato sul vocabolario che conosca, tra quelli con meno di 150 milioni di parametri.
A differenza dei sistemi di retrieval denso, che rappresentano ogni passaggio con un unico vettore continuo, SPARSEUP assegna pesi ai termini del vocabolario. L’output può essere memorizzato in un indice invertito e ispezionato quando un risultato di ricerca non funziona. Linkup presenta il modello come la controparte sparsa delle versioni DenseOn e LateOn di LightOn, utilizzando la stessa famiglia di architetture di base e gli stessi dati di fine-tuning per facilitare il confronto tra i tre approcci al retrieval.
SPARSEUP completa la linea di modelli di retrieval di LightOn
Linkup parte dal checkpoint LateOn-unsupervised, un modello basato su ModernBERT originariamente addestrato per il retrieval a interazione tardiva. Poiché quel checkpoint non includeva più una testa per il masked language modeling, il team vi ha innestato nuovamente la testa originale di ModernBERT prima del fine-tuning.
L’addestramento usa la miscela di fine-tuning di LightOn, con apprendimento contrastivo, sette hard negative estratti da un insieme di 50 per ogni query e negativi in-batch. Linkup afferma che l’addestramento è stato eseguito su una singola GPU H100 e non ha utilizzato la distillazione con cross-encoder. Prima che il modello produca un vettore sparso delle dimensioni del vocabolario, alle query e ai documenti vengono aggiunti i prefissi [Q] e [D]; il punteggio è calcolato con un prodotto scalare.
Tre modifiche mantengono sparso il vettore del vocabolario
Un’implementazione standard in stile SPLADE sulla stessa architettura di base produceva insiemi di termini molto ampi, contenenti parole vuote e termini non pertinenti. Linkup attribuisce il problema agli alti logit MLM di ModernBERT e alla possibilità che ogni token in input si espanda su circa 50.000 dimensioni del vocabolario.
Per prima cosa, SPARSEUP trasla i logit prima di applicare l’attivazione sparsa: log(1 + ReLU(x - 15)). Linkup ha scelto 15 dopo aver esaminato i documenti di MS MARCO e afferma che funzionano valori compresi tra 10 e 20. La traslazione porta le attivazioni deboli al di sotto della soglia oltre la quale produrrebbero insiemi di termini densi.
La seconda modifica mantiene soltanto le 12 dimensioni del vocabolario più forti per ogni token in input, prima del max pooling. Questo limite controlla l’espansione per token, invece di imporre un limite fisso al vettore finale. La terza modifica accorpa le varianti BPE a livello di byte. Forme come heat, Heat, Ġheat e ĠHeat vengono ricondotte a una sola voce canonica del vocabolario, riducendo lo spazio di output da circa 50.000 dimensioni a circa 34.000.
Un punteggio di 56,4 con compromessi evidenti
SPARSEUP raggiunge un nDCG@10 medio di 56,4 su BEIR-13, escludendo MS MARCO. Linkup afferma che, tra gli encoder sparsi con meno di 150 milioni di parametri che conosce, è il primo a superare il punteggio di 56. Il modello ottiene buoni risultati su ArguAna e Touché e supera DenseOn su HotpotQA, ma DBPedia è un punto debole e lo scarto maggiore rispetto a DenseOn si registra su FiQA.
Il confronto controllato con i modelli di LightOn è meno favorevole al sistema sparso. Usando la stessa famiglia di architetture di base e gli stessi dati di addestramento, LateOn ottiene 58,9 e DenseOn 57,9 su BEIR-13, contro il 56,4 di SPARSEUP. Linkup riferisce che per la valutazione SPARSEUP usa la ricerca approssimata di Seismic, mentre i risultati di LightOn si basano sulla ricerca esatta; il confronto, quindi, non mantiene costanti le condizioni di ricerca.
Sul BEIR decontaminato, SPARSEUP si avvicina a DenseOn, con uno scarto di 0,17 punti. Linkup avverte che i sottoinsiemi decontaminati di NQ e MS MARCO contengono rispettivamente solo 21 e 46 query, perciò le medie sono sensibili anche a variazioni minime.
La ricerca Seismic mantiene la latenza delle query sotto il millisecondo
Linkup riferisce che, su MS MARCO, SPARSEUP produce in media 47 termini non nulli per query e 190 per documento. Nello stesso confronto, SPLADE-v3 ne produce rispettivamente 25 e 170: le query di SPARSEUP sono quindi un po’ più dense, mentre le rappresentazioni dei documenti restano su valori simili.
Con un indice invertito Seismic, in un test a thread singolo SPARSEUP raggiunge un recall superiore al 97% rispetto alla ricerca esatta, impiegando circa 380 microsecondi per query. Il dato riguarda l’operazione di retrieval, non l’intera pipeline, e Linkup non lo confronta direttamente con sistemi densi o a interazione tardiva eseguiti su hardware diverso.
Linkup afferma che ampliare i vettori sparsi potrebbe migliorare le prestazioni su BEIR di circa uno o due punti, ma con questa versione ha scelto di mantenere più contenute le rappresentazioni. Questa scelta rende il modello meno competitivo su alcuni benchmark, ma ne preserva le caratteristiche di archiviazione e ispezionabilità, oltre alla compatibilità con gli indici invertiti, che distinguono il retrieval sparso dagli embedding densi.
I pesi sono disponibili con licenza Apache 2.0
I pesi di SPARSEUP sono disponibili nel repository del modello Linkup-Platform/linkup-sparseup-embed-v1. Gli sviluppatori possono caricarlo tramite Transformers o Sentence Transformers con trust_remote_code=True. Nel suo post, Linkup mette inoltre a disposizione strumenti per convertire gli output in dizionari di termini, visualizzare i termini con i relativi pesi e risalire ai sottotoken in input che hanno prodotto le dimensioni più forti.
La versione non viene presentata come un sostituto universale del retrieval denso. Linkup la descrive come una baseline open source con punti di forza e modalità di errore diverse: un buon abbinamento lessicale, output leggibile e ricerca approssimata in meno di un millisecondo, ma anche espansioni deboli per alcune entità e query numeriche. Il suo valore immediato è offrire ai team che si occupano di retrieval un modello sparso con licenza permissiva, da testare accanto alle alternative dense e a interazione tardiva in condizioni di addestramento simili.