Vai al contenuto
AI.info

The Pulse

Nokia presenta AnyJev per stabilizzare le decisioni degli LLM senza addestramento

AnyJev di Nokia Applied Research è un livello decisionale open source che usa la distribuzione del token successivo di un LLM per produrre scelte tipizzate e probabilità a cui applicare soglie, senza ulteriore addestramento del modello.

Nokia presenta AnyJev per stabilizzare le decisioni degli LLM senza addestramento

AI.info Team ·

AnyJev di Nokia Applied Research è un livello software open source progettato per rendere i modelli linguistici di grandi dimensioni più affidabili nelle decisioni tra opzioni definite, come l’instradamento, le verifiche sì/no e l’assegnazione di punteggi ordinali.

Il progetto legge la distribuzione del token successivo di un LLM senza generare una risposta né analizzare testo in forma libera. Affronta così due fonti di instabilità che il repository individua nella normale classificazione basata sui logit: la sensibilità all’ordine delle opzioni e punteggi di confidenza che non riflettono in modo affidabile la probabilità di avere ragione.

AnyJev è pubblicato con licenza Apache-2.0. Il repository indica come autori Jiamu Zhang, Tianze Yang e Liang Wu di Nokia a Sunnyvale, in California, insieme a Yucheng Shi di Tencent Hunyuan.

Perché l’ordine delle opzioni conta per AnyJev

Molte applicazioni degli LLM riducono il compito del modello alla selezione di un elemento da un insieme fisso. Uno sviluppatore può limitare il token successivo a etichette come «fatturazione», «tecnico» o «vendite», per poi trattare i valori softmax risultanti come probabilità. Secondo il repository di Nokia, questo approccio può produrre risposte diverse quando le stesse opzioni compaiono in un ordine diverso.

Il metodo L0 di AnyJev affronta il problema presentando le opzioni in K rotazioni, in modo che ciascuna candidata occupi una volta ogni posizione. Calcola la media del bias di posizione su queste rotazioni ed elimina il contributo della probabilità a priori dell’etichetta, riducendo l’effetto dell’ordine e della tendenza del modello a favorire una particolare risposta indipendentemente dall’input.

La libreria supporta tre primitive decisionali tipizzate: choice per selezionare una scelta tra un massimo di 26 opzioni, noul per una decisione sì/no con una probabilità per il valore vero e score per un risultato ordinale. Il README indica il supporto per transformers, mentre la compatibilità con i sistemi di serving vLLM e SGLang figura nella roadmap e non fa parte di questa versione.

Il benchmark su Qwen3-8B mostra una soglia di automazione più ampia

Nokia presenta il suo benchmark più chiaro su Qwen3-8B, usando 300 elementi di test tratti dal compito BANKING77 a 20 classi. Con i logit grezzi, invertire l’ordine delle opzioni ha cambiato la risposta nel 23% dei casi. AnyJev L0 ha ridotto questa percentuale al 7,3%, mentre L1, che aggiunge una calibrazione basata su esempi etichettati, ha registrato il 7,7%.

L’accuratezza è salita da 0,747 con i logit grezzi a 0,803 con L0 e 0,807 con L1. L’errore di calibrazione atteso, una misura della distanza tra la confidenza dichiarata e la correttezza osservata, è sceso da 0,240 a 0,184 con L0 e a 0,095 con L1.

La differenza maggiore è emersa nella misura di copertura-rischio del repository. Con una soglia di errore non superiore al 5%, i logit grezzi hanno classificato come sicuro da gestire automaticamente soltanto il 7,7% dei casi di test. L0 ha raggiunto il 46,3%, mentre L1 ha raggiunto il 52,0%. Nokia descrive il risultato come una stima puntuale basata su 300 elementi e avverte che l’intervallo è ampio.

Il valore di copertura riportato non è un tasso di automazione universale. La documentazione di AnyJev afferma che i team dovrebbero misurarlo sul proprio compito, modello e distribuzione dei casi da gestire.

L1 aggiunge calibrazione, non nuove conoscenze al modello

I livelli di AnyJev distinguono la correzione dei bias dalla calibrazione delle probabilità. La modalità raw applica una softmax ristretta ai token delle etichette consentite. L0 non richiede etichette e rimuove i bias di posizione e della probabilità a priori delle etichette, ma non garantisce che l’incertezza del modello sia calibrata.

L1 applica la regolazione della temperatura dopo L0 e richiede tra 100 e 500 esempi etichettati per ogni domanda. Rimodella la confidenza senza cambiare l’ordine delle scelte.

La maggiore stabilità comporta un costo computazionale. Una scelta fra K opzioni con L0 richiede K operazioni di prefill. Nokia riporta circa 0,25 secondi per decisione con una dimensione del batch di 32, per 20 opzioni su una H100. Il pacchetto può essere installato con pip install "anyjev[hf]".

I limiti indicati dal repository

AnyJev non migliora la capacità di fondo di un modello di rispondere a una domanda. La documentazione afferma che la calibrazione non può rimediare alla mancanza delle conoscenze necessarie e riporta casi in cui nessun metodo di lettura supera il riferimento banale sugli archi dei labirinti e su Minesweeper.

La probabilità a priori calcolata senza etichette può anche ridurre l’accuratezza quando una risposta domina nei dati. Nokia afferma che l’attuale implementazione è limitata a 26 opzioni nella lettura basata sulle lettere e che è prevista una lettura di sequenze di token per superare tale limite. Le tabelle dei benchmark si basano sui modelli Qwen; le righe relative a Llama e Gemma figurano nella roadmap del progetto, non sono presentate come valutazioni completate.

Il repository presenta AnyJev come un livello decisionale attorno a un modello aperto esistente, non come un modello sostitutivo. Il suo valore pratico dipende dalla necessità, per un team, di disporre di una soglia da esaminare e testare prima di consentire l’esecuzione automatizzata di un instradamento, un’approvazione, un’escalation o una chiamata a uno strumento.

Il repository di AnyJev di Nokia contiene l’implementazione, i file dei benchmark, la roadmap e i limiti dichiarati del progetto.

Fonte

Esplora

Altri articoli