Vai al contenuto
AI.info

The Pulse

Salesforce Koa supera GPT-4.1 nei benchmark sull’uso degli strumenti

Il modello Koa di Salesforce supera GPT-4.1 in due benchmark sull’uso degli strumenti, secondo il rapporto tecnico dell’azienda, ma resta indietro rispetto ai modelli di frontiera più avanzati nei confronti più ampi.

Salesforce Koa supera GPT-4.1 nei benchmark sull’uso degli strumenti

AI.info Team ·

Il nuovo modello Koa di Salesforce supera GPT-4.1 di OpenAI in diverse valutazioni sull’uso degli strumenti, ma lo studio della stessa azienda lo colloca al di sotto dei sistemi di frontiera più avanzati. I risultati presentano Koa non tanto come un sostituto dei modelli generalisti, quanto come un tentativo di specializzare un modello di base a pesi aperti per i flussi di lavoro aziendali.

Salesforce descrive Koa in un rapporto tecnico pubblicato su arXiv il 14 settembre 2026. Il modello parte da Nemotron-3-Super-120B, un modello di base a pesi aperti, e viene ulteriormente addestrato tramite Group Relative Policy Optimization, un metodo di apprendimento per rinforzo noto come GRPO.

«Su Tau2Bench raggiunge una media ponderata per attività di 69,41, superando di poco il modello Nemotron da cui deriva (68,64) e battendo GPT-4.1 di 14,9 punti».

Lo hanno scritto Zixiang Chen, co-primo autore del rapporto presso Salesforce Agentforce & AI Research, e gli altri coautori dello studio.

Gli autori affermano di utilizzare interazioni pubbliche e generate sinteticamente, anziché dati dei clienti. Secondo il rapporto, Salesforce ha sviluppato il sistema con NVIDIA.

I progressi di Koa derivano dalle specifiche dei flussi di lavoro

La principale particolarità di Koa è il modo in cui Salesforce costruisce le attività di addestramento. Per gli scenari aziendali, l’azienda usa Agent Script, il suo linguaggio dichiarativo per creare agenti Agentforce. Le specifiche di Agent Script descrivono l’instradamento delle richieste, i sottoagenti specializzati, le azioni tipizzate, gli strumenti disponibili e le istruzioni per i flussi di lavoro.

Una pipeline di simulazione converte queste specifiche in sessioni con più turni, basate su diversi scenari e profili utente. Gli ambienti risultanti espongono il modello alle chiamate agli strumenti, alle risposte degli utenti e allo stato del flusso di lavoro. Un modello ausiliario separato può impersonare il cliente simulato, produrre gli output degli strumenti quando non esiste un sistema di backend in produzione e valutare se l’attività è stata portata a termine.

Le ricompense dipendono dal completamento dell’attività, non soltanto dalla corrispondenza con una risposta di riferimento. Salesforce afferma che il modello valutatore verifica se ogni sottoquesito è stato risolto e richiede che le risposte specifiche per un cliente o un sistema siano fondate su una chiamata riuscita allo strumento pertinente. In una sandbox deterministica separata, la ricompensa è pari a 1 solo quando le azioni del modello riproducono lo stato finale previsto.

GPT-4.1 resta indietro in due test pubblici

Il rapporto valuta Koa su Tau2Bench, BFCL e CRM Bench. Tau2Bench misura le interazioni con il servizio clienti su più turni in attività legate a compagnie aeree, commercio al dettaglio e telecomunicazioni; BFCL valuta le chiamate agli strumenti in contesti che prevedono più passaggi, ricerche sul web, memoria e strumenti che mantengono uno stato; CRM Bench riguarda i flussi di lavoro di Salesforce e Agentforce.

Koa registra una media ponderata per attività di 69,41 su Tau2Bench, contro 68,64 del modello Nemotron da cui deriva e 54,48 di GPT-4.1. Su BFCL, Koa ottiene il 66,63%, davanti al 64,73% del modello di partenza e al 53,96% di GPT-4.1.

I risultati su CRM sono più ravvicinati. Koa raggiunge un punteggio complessivo di 0,86, contro 0,84 di Nemotron-3-Super-120B, 0,81 di GPT-4.1 e 0,87 di Claude Opus 4.8. La precisione di Koa nelle chiamate alle funzioni è di 0,77, rispetto a 0,71 del modello da cui deriva, mentre il suo risultato complessivo su CRM resta appena sotto quello di Opus 4.8.

I pesi aperti offrono controllo, ma con un limite alle prestazioni

Salesforce presenta i risultati come prova del fatto che l’apprendimento per rinforzo guidato dalle specifiche può adattare un modello a pesi aperti al lavoro degli agenti aziendali. L’approccio offre inoltre all’azienda un modo per collegare la creazione degli agenti all’addestramento del modello: le stesse specifiche di Agent Script usate per configurare un agente Agentforce forniscono la struttura degli ambienti di addestramento e delle verifiche sul completamento delle attività.

Nei confronti presentati nello studio, questo vantaggio ha però un limite evidente. Nella tabella più ampia dei benchmark, Koa resta al di sotto dei modelli proprietari più avanzati. Claude Opus 4.8 registra una media ponderata di 74,00 su Tau2Bench e il 78,18% su BFCL, mentre GPT-5.5 di OpenAI raggiunge rispettivamente 83,99 e il 67,63%. I due modelli primeggiano in test diversi, ma nessuno dei due confronti consente di affermare che Koa sia all’altezza dei modelli di frontiera su tutti i fronti.

Gli autori invitano inoltre alla cautela nel generalizzare una delle conclusioni sull’addestramento. In un confronto circoscritto, l’apprendimento per rinforzo ha prodotto risultati sostanzialmente migliori del fine-tuning supervisionato nell’uso degli strumenti su più turni, mentre il fine-tuning supervisionato è rimasto competitivo nelle attività CRM a turno singolo. Poiché il modello di partenza era già stato sottoposto a un addestramento successivo basato sull’apprendimento per rinforzo, lo studio afferma che il risultato potrebbe non valere per un modello di base prima dell’apprendimento per rinforzo.

Un modello pensato per lo spazio intermedio delle attività operative

Koa si rivolge allo spazio tra un modello di base generalista e un sistema di agenti aziendali interamente gestito. In questo contesto, l’uso degli strumenti richiede più che produrre una risposta plausibile: il modello deve individuare l’operazione giusta, fornire argomenti validi, rispettare gli strumenti disponibili per un determinato sottoagente e proseguire per diversi turni fino a raggiungere lo stato richiesto.

I risultati di Salesforce suggeriscono che un addestramento specifico per i flussi di lavoro può migliorare questi comportamenti senza utilizzare i dati dei clienti durante l’addestramento. Non dimostrano che Koa sia il miglior modello generalista, né stabiliscono come si comporti nelle implementazioni Salesforce in uso. Lo studio presenta invece un risultato più circoscritto: un modello a pesi aperti può ottenere miglioramenti misurabili nell’uso degli strumenti e nelle capacità CRM quando l’apprendimento per rinforzo è guidato da specifiche eseguibili dei flussi di lavoro e da ricompense legate al completamento delle attività.

Fonte

Esplora

Altri articoli