Vai al contenuto
AI.info

The Pulse

ToolGrad di Google riduce i costi dei dati per l’addestramento degli agenti

Google Research presenta ToolGrad, un framework che genera flussi di lavoro API verificati prima di scrivere i prompt degli utenti. Il sistema raggiunge un tasso di superamento del 99,8% e produce catene di utilizzo degli strumenti più comp

ToolGrad di Google riduce i costi dei dati per l’addestramento degli agenti

AI.info Team ·

ToolGrad raggiunge un tasso di superamento del 99,8% nella generazione di esempi di addestramento per sistemi di IA che utilizzano strumenti esterni, secondo Google Research. Il framework produce anche catene di utilizzo degli strumenti più lunghe, riducendo al contempo il numero di passaggi di esecuzione degli strumenti necessari per creare ciascun esempio.

Google Research ha presentato ToolGrad il 10 settembre 2026, descrivendolo come un metodo che parte dalla risposta per creare dataset. Invece di inventare una richiesta dell’utente e poi chiedere a un agente di trovare una sequenza di API praticabile, ToolGrad crea prima una sequenza valida di chiamate agli strumenti e genera in seguito una richiesta corrispondente.

Il metodo si concentra su una delle parti più costose dell’addestramento di un agente: produrre esempi affidabili che colleghino una richiesta in linguaggio naturale a una sequenza di chiamate API e a una risposta finale. Nel suo post, Google presenta il lavoro insieme a un articolo di ricerca e alla relativa implementazione.

ToolGrad inverte la pipeline di creazione dei dataset

I sistemi precedenti, che partono dalla query, iniziano campionando API e creando un’istruzione ipotetica. Un agente cerca poi una soluzione, spesso tramite ricerca in profondità, e conserva le tracce che hanno avuto successo per l’addestramento. Google afferma che questo processo spreca chiamate al modello per richieste che non possono essere risolte con gli strumenti selezionati e può far sì che passaggi falliti o errati finiscano nel dataset risultante.

ToolGrad parte da almeno un’azione API riuscita. Il flusso di lavoro si sviluppa quindi attraverso cicli ripetuti in cui vengono proposte API candidate, eseguite in parallelo, valutate e infine selezionate o scartate. Una volta completata la catena, un modello linguistico aggiorna la richiesta sintetica dell’utente e la risposta finale affinché corrispondano al flusso di lavoro verificato.

Quattro moduli creano una catena di strumenti verificata

Il sistema suddivide il lavoro tra quattro componenti. Un API Proposer restringe un gruppo campionato di API alle candidate che potrebbero estendere il flusso di lavoro in corso. Gli API Executors verificano queste candidate e producono rapporti di esecuzione, mentre un API Selector sceglie la chiamata successiva più promettente.

Un LLM Updater rivede quindi la richiesta sintetica e la risposta in base alla sequenza di API ampliata. Google paragona il feedback del selettore a un gradiente testuale: invece di un segnale numerico che modifica i pesi del modello, una valutazione in linguaggio naturale guida il passaggio successivo nella costruzione del flusso di lavoro.

Ogni esempio completato contiene un prompt dell’utente, una catena verificata di utilizzo degli strumenti e una risposta dell’IA. L’obiettivo è rendere affidabile la sequenza di strumenti prima che il sistema chieda a un modello di esprimere in linguaggio naturale l’obiettivo dell’utente.

Tasso di superamento del 99,8% su 16.000 API

Google ha confrontato ToolGrad con il processo che parte dalla query utilizzato con ToolBench, un database di API che contiene oltre 16.000 API del mondo reale. ToolGrad ha prodotto in media 3,4 utilizzi di strumenti verificati per campione, rispetto ai 2,1 della baseline basata sulla ricerca in profondità.

Il tasso di superamento è salito dal 63,8% della baseline al 99,8% di ToolGrad. L’articolo riporta che il numero medio di chiamate ai modelli linguistici è diminuito leggermente, da 64,5 a 63,9, mentre i passaggi di utilizzo degli strumenti sono scesi da 34,3 a 20,0. Google attribuisce il restante 0,2% di insuccessi ai casi in cui il sistema non è riuscito a ottenere una risposta valida dalle API selezionate nel corso delle iterazioni.

Il risultato non significa che ogni aspetto dell’addestramento degli agenti diventi meno costoso. Misura il costo della generazione dei dati sintetici sull’utilizzo degli strumenti, e il confronto riguarda la specifica configurazione di ToolBench descritta dai ricercatori.

I modelli Gemma-3 migliorano con strumenti mai visti

Per un secondo esperimento, i ricercatori hanno creato ToolGrad-500, un dataset di 500 campioni realizzato con le API di ToolBench. Hanno eseguito il fine-tuning dei modelli Gemma-3 con 1 miliardo, 4 miliardi e 12 miliardi di parametri, chiamando i sistemi risultanti ToolGrad-1B, ToolGrad-4B e ToolGrad-12B.

Nella Berkeley Function Calling Leaderboard, che utilizza un insieme di strumenti diverso da quello di ToolBench, tutti e tre i modelli sottoposti a fine-tuning hanno migliorato i risultati delle rispettive versioni di base. ToolGrad-12B ha ottenuto 83,1, un risultato vicino a Gemini 2.5 Pro, con 83,2, e a Claude 4.5 Opus, con 82,8, nel confronto riportato da Google. Nella stessa tabella, GPT-5 ha ottenuto 74,4.

Google afferma che il dataset di 500 esempi è stato generato con Gemini 2.5 Flash-Lite, eppure Gemma-3-12B, sottoposto a fine-tuning su quei dati, ha superato il modello insegnante nelle valutazioni riportate. Il risultato suggerisce che la struttura degli esempi, e non soltanto le dimensioni o le capacità del modello che li ha generati, influisce sulle prestazioni nell’utilizzo degli strumenti.

I limiti di scalabilità di ToolGrad sono già evidenti

L’articolo segnala alcuni limiti insieme ai risultati principali. In uno studio sulla scalabilità, i tassi di superamento tendevano a stabilizzarsi tra le otto e le dodici iterazioni; i ricercatori hanno scelto dieci iterazioni per ToolGrad-500 come impostazione attenta ai costi. Il sistema ha anche iniziato a generare schemi di utilizzo degli strumenti simili tra i campioni, perché ciascun esempio veniva creato indipendentemente, senza un meccanismo di memoria condivisa.

Google avverte inoltre che le richieste sintetiche potrebbero non rispecchiare il modo in cui le persone descrivono spontaneamente i propri obiettivi. Il lavoro attuale si concentra sul fine-tuning supervisionato anziché sull’apprendimento per rinforzo, e gli autori affermano che non mostra ancora quanto i dati siano trasferibili a ogni framework per agenti o metodo di ragionamento.

ToolGrad offre quindi un risultato più circoscritto di una soluzione generale all’addestramento degli agenti: negli esperimenti riportati, rende più efficace e meno dispendiosa una pipeline di generazione dei dati. La prossima prova tecnica sarà capire se il metodo che parte dalla risposta riuscirà a continuare a produrre flussi di lavoro vari e allineati alle preferenze umane quando, su scala maggiore, emergeranno gli attuali limiti relativi alle iterazioni e alla diversità.

Fonte

Esplora

Altri articoli