The Pulse
IBM punta a colmare il divario di coerenza di 24 punti negli agenti di IA
I ricercatori di IBM descrivono un metodo per individuare e ridurre le decisioni incoerenti negli agenti di IA. La citazione in blocco della fonte non era attribuita, quindi è stata omessa.

AI.info Team ·
Un agente di IA può risolvere correttamente un compito e restare comunque inaffidabile. I ricercatori di IBM affermano che un agente ReAct basato su GPT-4.1 ha completato con successo il 77,4% delle esecuzioni sul benchmark AppWorld, ma ha portato a termine tutte e cinque le ripetizioni di un compito solo nel 53,0% dei casi.
Questa differenza di 24,4 punti è il problema che affronta una nuova funzionalità del toolkit open source ALTK-Evolve di IBM. Il sistema, descritto in un articolo del 15 settembre su Hugging Face, analizza le decisioni registrate di un agente, individua i passaggi che potrebbero cambiare in un’altra esecuzione e trasforma queste conclusioni in indicazioni per le esecuzioni future.
I ricercatori di IBM chiamano «divario di coerenza» la differenza tra il successo medio e il successo in ogni esecuzione ripetuta. Il loro lavoro sostiene che il dato standard sull’accuratezza, usato in molte valutazioni degli agenti, può nascondere gli errori che gli utenti incontrano quando chiedono a un agente di ripetere la stessa operazione.
L’accuratezza media non rileva gli errori nelle esecuzioni ripetute
La maggior parte dei benchmark per agenti riporta il tasso medio di superamento su diversi tentativi. L’articolo di IBM definisce questa metrica Mean@k: la percentuale media di esecuzioni riuscite quando un compito viene eseguito k volte. Una misura distinta, Passk, conta solo i compiti portati a termine con successo in tutte le esecuzioni.
La distinzione è importante per flussi di lavoro come la riconciliazione finanziaria, la revisione dei contratti o la manutenzione del software. Un sistema che riesce quattro volte su cinque può sembrare molto efficace nel complesso, ma può comunque produrre risultati incoerenti ogni volta che un utente ripete la stessa richiesta.
IBM riferisce che il divario di coerenza aumenta nei compiti più difficili di AppWorld, raggiungendo i 30 punti percentuali nella valutazione descritta nell’articolo. I ricercatori affermano che il problema è distinto dalle capacità generali del modello: un modello può ottenere buoni risultati in media e fare comunque scelte instabili durante un processo articolato in più passaggi.
ALTK-Evolve cerca le decisioni instabili
Il nuovo Consistency Analyzer parte da una singola traiettoria registrata, invece di eseguire nuovamente l’intero compito nell’ambiente. Ripercorre ogni punto decisionale nella traccia esistente e, per impostazione predefinita, richiede cinque completamenti, misurando quanto varia l’output del modello in quel passaggio.
Il processo richiede una chiamata aggiuntiva al modello per ogni punto decisionale e non necessita dell’accesso ai logit del modello né di strumenti di monitoraggio interni. Inoltre, secondo i ricercatori, non richiede un valutatore né una seconda esecuzione completa dall’inizio alla fine. Il risultato è una scheda di valutazione che mette in evidenza le decisioni in cui piccoli cambiamenti potrebbero indirizzare l’agente verso un percorso diverso.
Queste decisioni potrebbero riguardare la selezione di un’API, la formulazione di un argomento per uno strumento, la scelta di un risultato di ricerca o la decisione di riprovare. Secondo la spiegazione di IBM, la variazione dipende da probabilità dei token quasi equivalenti: quando diversi token successivi possibili hanno probabilità simili, piccoli cambiamenti nelle condizioni di erogazione possono modificare l’azione selezionata, anche se l’agente viene eseguito con temperatura zero.
Le linee guida migliorano la coerenza su cinque esecuzioni
ALTK-Evolve trasforma le decisioni segnalate in «linee guida per la coerenza», che vengono archiviate insieme alla memoria già presente nel toolkit e recuperate all’avvio di un compito correlato. Le linee guida si concentrano su schemi che possono ripetersi in compiti diversi, invece di conservare una singola sequenza riuscita.
Un esempio riguarda un compito di AppWorld in cui si chiede a un agente di contare le attività completate in una nota di SimpleNote. Le indicazioni generate dicono all’agente di usare un’espressione regolare ancorata alla riga invece di contare le semplici sottostringhe, perché il titolo della nota potrebbe ripetere lo stesso simbolo di marcatura. Un’altra linea guida dice all’agente di verificare più risultati di ricerca prima di selezionare la nota corretta.
IBM ha valutato l’approccio su 168 compiti test_normal di AppWorld usando un agente ReAct basato su GPT-4.1. Dopo aver generato le linee guida a partire da una traiettoria di riferimento per ciascun compito, i ricercatori hanno testato ogni compito in cinque nuove esecuzioni.
Pass5 è salito dal 53,0% al 69,0%. Mean@5 è aumentato dal 77,4% all’81,0%, riducendo il divario di coerenza da 24,4 a 12,0 punti. IBM afferma che il sistema ha migliorato l’accuratezza media, senza sacrificarla in nome della maggiore ripetibilità.
Il metodo si applica anche ad altre traiettorie
Le linee guida hanno migliorato le prestazioni anche su varianti di compiti correlati. Nei compiti simili degli stessi scenari di AppWorld, Pass5 è aumentato di 13,0 punti percentuali, rispetto a un incremento di 16,0 punti nei compiti originali.
I ricercatori hanno testato anche il modello più debole gpt-oss-120b. Pass5 sullo stesso compito è aumentato di 6,0 punti, dal 10,1% al 16,1%, mentre le prestazioni sui compiti simili sono cresciute di 8,7 punti. IBM presenta il risultato come prova che il sistema individua schemi di errore riutilizzabili, invece di memorizzare una singola traiettoria.
Il toolkit è disponibile nel repository GitHub di ALTK-Evolve, che include il Consistency Analyzer e i componenti per generare le linee guida usati negli esperimenti. Il framework più ampio archivia le traiettorie degli agenti, estrae indicazioni operative e inserisce le istruzioni pertinenti nelle esecuzioni successive.
Un criterio diverso per l’affidabilità degli agenti
La proposta di IBM non sostituisce le normali misure di accuratezza. Aggiunge una domanda più rigorosa: un agente è in grado di completare ripetutamente lo stesso compito senza cambiare risposta o compromettere il flusso di lavoro?
Questa distinzione offre agli sviluppatori un modo per separare un agente capace da uno affidabile. I risultati dell’azienda non dimostrano che ogni agente diventerà coerente, ma mostrano una riduzione misurabile degli errori nelle esecuzioni ripetute, senza dover ricorrere a un modello più grande o ripetere l’intero compito.
IBM raccomanda ai team che implementano agenti articolati in più passaggi di riportare Passk insieme a Mean@k. I due dati mostrano se il tasso di successo di un sistema riflette un comportamento affidabile o una serie di successi occasionali.