Ricerca
Verifica dei leaderboard per agenti basata sulla misurazione: suscettibilità alla contaminazione, rivalutazione con controlli abbinati e validazione del sistema di valutazione
I leaderboard per agenti valutano sempre più spesso i sistemi su benchmark pubblici, i cui enunciati dei compiti e materiali contenenti le soluzioni possono rimanere accessibili. Proponiamo un quadro

- arXiv
- 2610.05830
- Pubblicato
- 2026-10-05
- Autori
- Dishu Yang, Qi Su, Hongbo Qin, Hansong Zhang
Abstract degli autori
I leaderboard per agenti valutano sempre più spesso i sistemi su benchmark pubblici, i cui enunciati dei compiti e materiali contenenti le soluzioni possono rimanere accessibili. Proponiamo un quadro di verifica basato anzitutto sulla misurazione, che distingue le affermazioni sulla contaminazione in base alle prove necessarie per sostenerle. Il quadro separa tre canali che richiedono prove diverse: l’esposizione durante l’addestramento, il recupero di informazioni durante la valutazione e la fuga di informazioni tramite pipeline o scaffold. Secondo una regola fail-closed, ciascun canale è classificato come aperto, parziale, chiuso o sconosciuto. Nelle nove configurazioni di Holistic Agent Leaderboard (HAL), nessuna delle 27 valutazioni dei canali è stata classificata come chiusa, ma sono stati confermati incidenti in quattro configurazioni. Applichiamo poi la componente comportamentale del quadro a un divario segnalato nella localizzazione dei file su SWE-bench Verified, usando un disegno con controlli abbinati nello stesso repository e selezionati senza conoscere gli esiti, uno screening simmetrico delle fughe di informazioni nei prompt, analisi dell’incertezza per coppie e che tengono conto dei repository, e la validazione del sistema di valutazione. La valutazione è condotta su GPT-4.1 e DeepSeek-V4-Flash. Tra le 100 coppie rimaste dopo lo screening simmetrico e l’esclusione delle coppie non integre, GPT-4.1 ha mostrato un divario Top-3 associato al benchmark di $+10.0$ punti, ponderato per coppia; tuttavia, gli intervalli al 95\% ottenuti sia con la procedura bootstrap per coppie prestabilita sia con l’analisi post-hoc bilanciata per repository comprendevano lo zero, lasciando inconcludente il divario associato al benchmark. Il sistema di valutazione usato nella riproduzione non ha superato la verifica di validazione: rispetto alle etichette concordate dai valutatori umani, non è stato possibile accertare una sensibilità sufficiente per nessuno dei due modelli, ed entrambe le segnalazioni relative a DeepSeek-V4-Flash nei confronti con soluzioni gold corrette erano falsi positivi. Senza prove sulla provenienza, controlli adeguati, uno screening simmetrico delle fughe di informazioni e sistemi di valutazione validati, affermazioni più forti sulla contaminazione non sono giustificate. I risultati non accertano la presenza dei dati nei set di addestramento, la prevalenza della contaminazione né un aumento dei punteggi indotto dal benchmark.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv