Vai al contenuto
AI.info

The Pulse

Il modello Laya di Convai Innovations restituisce decisioni tipizzate in un solo passaggio

Il modello Laya di Convai Innovations usa ModernBERT e una testa decisionale per restituire risposte tipizzate, probabilità e valori di confidenza nei flussi di lavoro di instradamento, scoring e classificazione calibrata.

Il modello Laya di Convai Innovations restituisce decisioni tipizzate in un solo passaggio

AI.info Team ·

Laya tratta l’output dell’IA come una decisione, non come un paragrafo

Laya di Convai Innovations è un modello da 421 milioni di parametri che accetta testo, email, ticket o JSON come stato e risponde a domande tipizzate senza generare una risposta in linguaggio naturale. La scheda del modello lo descrive come un modello decisionale multilingue e non autoregressivo che restituisce risposte tipizzate con probabilità in un solo passaggio in avanti.

Laya è disponibile tramite il repository del modello di Convai Innovations su Hugging Face con licenza Apache 2.0. Il repository contiene tre checkpoint: il modello inglese nella cartella principale, un modello multilingue in una sottocartella e un modello di decisioni tipizzate in una seconda sottocartella. I checkpoint inglese e di decisioni tipizzate hanno 421 milioni di parametri, mentre quello multilingue ne ha 322 milioni.

Il modello supporta tre tipi di domande. choice restituisce un’opzione selezionata, una probabilità per ciascuna opzione e un valore di confidenza. score restituisce un livello atteso su una scala ordinale, insieme a una distribuzione e a un valore di confidenza. noul restituisce una probabilità calibrata che un’affermazione sia vera.

ModernBERT fornisce l’encoder

I checkpoint inglese e di decisioni tipizzate usano ModernBERT-large come modello di base. L’architettura combina l’encoder da 395 milioni di parametri con una testa decisionale addestrata da zero, per un totale di 421 milioni di parametri.

Laya assegna un punteggio a ciascuna opzione di risposta nel proprio marcatore [MASK] prima di applicare una softmax alle opzioni di quella domanda. Il checkpoint inglese standard ha un budget di 512 token per domanda. Il checkpoint di decisioni tipizzate è indicato con una finestra di contesto di 1.024 token.

Poiché il modello restituisce direttamente output strutturati, un’applicazione non deve chiedere a un modello generativo di produrre JSON per poi analizzare un paragrafo. Laya restituisce la risposta selezionata, la relativa distribuzione di probabilità e un valore di confidenza. Il repository afferma che non genera mai testo.

Un solo passaggio in avanti per l’instradamento e il triage

La guida rapida mostra come instradare ticket di assistenza, assegnare un punteggio di urgenza e rilevare il rischio di abbandono con una sola chiamata. Un ticket di esempio può essere assegnato a un reparto, valutato per urgenza e controllato per verificare se l’utente minaccia di annullare il servizio. Il repository fornisce anche un instradatore che seleziona tra i checkpoint inglese, multilingue e di decisioni tipizzate.

Su una Tesla T4, la scheda del modello riporta 39,5 millisecondi per una domanda con il checkpoint inglese e 32,8 millisecondi con quello multilingue. Dieci domande richiedono rispettivamente 158,6 millisecondi e 72,3 millisecondi. Per 50 domande, i tempi riportati sono 771 millisecondi per l’inglese e 337 millisecondi per il multilingue. La documentazione riporta da 103 a 332 domande al secondo quando le richieste vengono raggruppate in batch.

Il progetto mette a disposizione un pacchetto Python tramite PyPI. Gli sviluppatori possono installarlo con pip install laya, caricare un checkpoint, fornire un oggetto di stato e inviare più domande tipizzate con una sola chiamata. Il repository rimanda anche a una demo di Laya accessibile dal browser.

I risultati dei benchmark variano in base al checkpoint e al compito

In un benchmark di decisioni tipizzate che copre 400 casi e 2.000 decisioni, il checkpoint laya-typed-decisions sottoposto a fine-tuning registra un’accuratezza di 0,766, un’accuratezza soft di 0,471, un punteggio Brier di 0,062, un errore di calibrazione atteso di 0,213 e un errore assoluto medio del punteggio di 0,242. La stessa tabella riporta un’accuratezza di 0,362 per il checkpoint inglese e di 0,342 per quello multilingue.

Il checkpoint sottoposto a fine-tuning registra un’accuratezza di 0,804 nell’elaborazione delle fatture, di 0,766 negli incidenti di sicurezza, di 0,764 nel servizio clienti e di 0,730 nell’osservabilità delle tracce degli agenti. Per primitiva di domanda, i risultati sono 0,857 per noul, 0,733 per choice e 0,723 per score.

Sui compiti in inglese, la scheda del modello riporta un’accuratezza di 0,947 su AG News, 0,830 su BoolQ, 0,573 su DAIR Emotion, 0,698 sugli esempi di prompt injection e 0,372 sul compito ordinale SST-5. Sul benchmark di intenti MASSIVE, il checkpoint multilingue raggiunge una media macro di 0,227 e un errore di calibrazione atteso macro di 0,733 su 51 lingue.

Limiti e uso previsto

La documentazione avverte che, senza fine-tuning specifico per il compito, i checkpoint inglese e multilingue di base ottengono risultati vicini al caso nel benchmark di decisioni tipizzate. Specifica che il risultato di 0,766 è quello del checkpoint sottoposto a fine-tuning sulla suddivisione di addestramento del benchmark, non un risultato zero-shot.

La scheda del modello consiglia di mantenere le domande choice al di sotto di circa 20 opzioni, perché il budget fisso di etichette può ridurre l’accuratezza quando le opzioni sono troppe. Indica inoltre le domande ordinali score come la primitiva più debole tra i risultati in inglese riportati. Il punteggio di confidenza non segnala quando un input è illeggibile, quindi il repository afferma che la scelta del checkpoint deve avvenire prima del passaggio in avanti: è a questo scopo che serve l’instradatore.

Laya viene presentato come un componente decisionale per applicazioni che richiedono output circoscritti, stime di probabilità e distribuzione locale. I risultati dipendono dal checkpoint selezionato, dal formato del compito e dal fatto che il modello sia stato sottoposto a fine-tuning per il flusso di lavoro previsto.

Fonte

Esplora

Altri articoli