Vai al contenuto
AI.info

Ricerca

EarlyEval: valutare gli agenti a costi inferiori prevedendo in anticipo l’esito

Valutare gli agenti basati su LLM è essenziale per guidarne lo sviluppo, ma è diventato proibitivamente costoso: una sola esecuzione di un modello di frontiera su un benchmark per agenti può costare d

EarlyEval: valutare gli agenti a costi inferiori prevedendo in anticipo l’esito
arXiv
2609.02783
Pubblicato
2026-09-02
Autori
Yuling Shi, Zhensu Sun, Junsen Dong, Chengcheng Wan, David Lo, Xiaodong Gu

Abstract degli autori

Valutare gli agenti basati su LLM è essenziale per guidarne lo sviluppo, ma è diventato proibitivamente costoso: una sola esecuzione di un modello di frontiera su un benchmark per agenti può costare da centinaia a migliaia di dollari, una spesa che si ripete nei successivi cicli di sviluppo. I lavori precedenti, incentrati sulla distillazione dei benchmark, riducono il numero di compiti da valutare, ma non il costo di esecuzione di ciascun compito mantenuto. In questo lavoro introduciamo la previsione anticipata dell’esito, un approccio complementare per migliorare l’efficienza che riduce invece il costo all’interno di ogni compito. L’intuizione alla base è che spesso l’esito finale di un agente è già evidente dal suo comportamento intermedio, molto prima che l’esecuzione sia terminata. Concretizziamo questa idea in EarlyEval, un framework leggero che addestra una coppia di classificatori LightGBM, uno per il successo e uno per l’insuccesso, su caratteristiche comportamentali, testuali e relative alla soluzione di riferimento. EarlyEval interrompe l’esecuzione dell’agente non appena uno dei due classificatori supera una soglia di confidenza calibrata, aggiungendo un sovraccarico trascurabile a ogni passaggio. Su tre benchmark, SWE-bench Verified, TerminalBench e Toolathlon, EarlyEval può eliminare dal 13% al 26% dei passaggi dell’agente e fino al 44,1% dei token di input e al 29,4% dei token di output, con un’accuratezza delle previsioni compresa tra l’89% e il 97%, modificando i tassi di risoluzione di ciascun agente in media di appena uno o due punti percentuali.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv