Vai al contenuto
AI.info

Ricerca

JEV-as-a-judge: accetta quando è sicuro, passa a una valutazione superiore quando è incerto

La valutazione tramite LLM consente di esaminare compiti diversi, ma su larga scala diventano cruciali i costi di inferenza e l’affidabilità delle stime di confidenza. Studiamo se un giudice che resti

JEV-as-a-judge: accetta quando è sicuro, passa a una valutazione superiore quando è incerto
arXiv
2609.26550
Pubblicato
2026-09-22
Autori
Yubo Li, Yidi Miao, Ramayya Krishnan, Rema Padman

Abstract degli autori

La valutazione tramite LLM consente di esaminare compiti diversi, ma su larga scala diventano cruciali i costi di inferenza e l’affidabilità delle stime di confidenza. Studiamo se un giudice che restituisce solo una decisione possa fornire una prima valutazione economica e individuare quando serve una valutazione più approfondita. Confrontando jev-as-a-judge con sedici giudici basati su modelli generativi e modelli di ricompensa, e ricorrendo a una valutazione umana in cieco, rileviamo che, nelle normali valutazioni delle preferenze e della factualità basata su evidenze, il sistema si discosta di meno di tre punti percentuali da un giudice LLM all’avanguardia, il nostro termine di confronto più solido, a fronte di un costo pari allo 0,36% di quello del termine di confronto. Le differenze aumentano quando i giudizi richiedono di verificare una derivazione o di resistere a una risposta sbagliata formulata in modo elaborato. In diversi benchmark, il divario di JEV rispetto a questo termine di confronto è concentrato nelle decisioni con un basso livello di confidenza. Una cascata a configurazione fissa, che accetta i verdetti espressi con sicurezza e passa quelli incerti a una valutazione superiore, mantiene il 99% dell’accuratezza del termine di confronto a un costo inferiore.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv