Ricerca
AgentJudgeBench: un benchmark a più livelli di difficoltà per valutare i giudici LLM nelle chiamate agli strumenti da parte degli agenti
I giudici LLM sono ampiamente usati per valutare i sistemi in cui gli agenti chiamano strumenti, ma la loro affidabilità nei flussi di lavoro strutturati e basati su dipendenze resta in gran parte ine

- arXiv
- 2608.26623
- Pubblicato
- 2026-08-27
- Autori
- Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru
Abstract degli autori
I giudici LLM sono ampiamente usati per valutare i sistemi in cui gli agenti chiamano strumenti, ma la loro affidabilità nei flussi di lavoro strutturati e basati su dipendenze resta in gran parte inesplorata. Presentiamo AgentJudgeBench, il primo benchmark che studia sistematicamente l’affidabilità dei giudici LLM nelle chiamate agli strumenti da parte degli agenti su DAG dei flussi di lavoro, distinguendo questo compito dalla più ampia valutazione, tramite giudici LLM, di testi a risposta aperta o preferenze. Il benchmark comprende 3.808 istanze, distribuite su sei topologie DAG e tre livelli di difficoltà, valutate con cinque generatori (modelli a pesi aperti da 3B a 70B e GPT-5.4) e sei giudici (da 20B fino alla scala dei modelli di frontiera), in condizioni abbinate con e senza verità di riferimento. La concordanza dei giudici diminuisce progressivamente all’aumentare della difficoltà del compito, a un ritmo 1,5 volte più rapido senza verità di riferimento. Per le richieste difficili senza verità di riferimento, tutti e sei i giudici si collocano nella ristretta fascia del 77-82%, indipendentemente dalla scala: emerge così un limite strutturale determinato soprattutto dalla difficoltà del compito, la cui soglia dipende in parte dal prompt per i generatori meno potenti e che la sola capacità del modello non può superare. L’accesso alla verità di riferimento non è sempre vantaggioso: riduce la concordanza di GPT-5.4 (1,5 punti percentuali) e Gemini-2.5-Pro (3,9 punti percentuali), un risultato coerente con un ancoraggio eccessivo. Tra le strategie di mitigazione, il ragionamento chain-of-thought e la temperatura del giudice hanno entrambi un effetto trascurabile, mentre le griglie di valutazione strutturate migliorano la concordanza fino a 6,5 punti percentuali, ma non si generalizzano in modo uniforme alle diverse coppie giudice-generatore. Con la verità di riferimento, QwQ-32B è il più concorde con il riferimento programmatico, mentre uno studio di validazione condotto da esseri umani individua in GPT-OSS-120B il giudice più concorde con le valutazioni umane; senza verità di riferimento, i giudici di frontiera ottengono solo un lieve vantaggio entro il limite condiviso. Questi risultati mettono in luce i limiti fondamentali degli attuali giudici LLM e forniscono indicazioni pratiche per una valutazione affidabile nei sistemi basati su agenti.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv