Vai al contenuto
AI.info

Ricerca

Benchmark Radar: una banca dati in costante aggiornamento e un motore di ricerca per i benchmark e la valutazione dell’IA

Chi fa ricerca sui benchmark e chi sviluppa modelli linguistici di grandi dimensioni (LLMs) e altri sistemi di IA ha bisogno di trovare valutazioni pertinenti, individuare i relativi dataset e il codi

Benchmark Radar: una banca dati in costante aggiornamento e un motore di ricerca per i benchmark e la valutazione dell’IA
arXiv
2609.11115
Pubblicato
2026-09-10
Autori
Koutian Wu, Junjie Zhou, Ergan Shang, Jiayu Wang, Pengqian Han, Junkai Wang, Wanghan Xu, Songyuanyi Lu, Lin Shi

Abstract degli autori

Chi fa ricerca sui benchmark e chi sviluppa modelli linguistici di grandi dimensioni (LLMs) e altri sistemi di IA ha bisogno di trovare valutazioni pertinenti, individuare i relativi dataset e il codice dei benchmark e comprendere le condizioni in cui sono stati ottenuti i punteggi riportati. Presentiamo Benchmark Radar, una banca dati in costante aggiornamento e un motore di ricerca per trovare e scoprire benchmark di IA. Copre la valutazione degli LLM, i benchmark per gli agenti e l’uso di strumenti, la programmazione, il ragionamento, la sicurezza e le valutazioni specifiche per dominio. Il sistema combina la scoperta quotidiana di articoli sui benchmark, repository, dataset e release con un catalogo di benchmark consultabile tramite ricerca, le menzioni nelle schede dei modelli e nei rapporti tecnici e le serie storiche dei punteggi. Conserva l’identità delle fonti e le citazioni, così che i lettori possano esaminare i benchmark individuati e le evidenze relative alla loro valutazione. La scoperta quotidiana si basa su 37 fonti: 13 connettori diretti e 24 feed di ricerca e ingegneria di prima parte. Il catalogo contiene 1.283 schede delle fonti tratte da 4 cataloghi di benchmark e 12.916 osservazioni numeriche relative a 790 schede. Descriviamo la raccolta e il reperimento delle informazioni, esaminiamo l’intero catalogo e analizziamo la saturazione dei benchmark, le tendenze di adozione e i limiti dei confronti tra punteggi. Un esempio guidato illustra una ricerca completa dei lavori precedenti, mostrando come interrogare il catalogo ed esaminare le evidenze sui benchmark quando si progetta una nuova valutazione. Rendiamo disponibili la dashboard web con una classifica dei benchmark, una visualizzazione della frontiera di Pareto che mette in relazione il punteggio con l’utilizzo misurato, visualizzazioni della saturazione e delle tendenze, feed quotidiani, evidenze scaricabili, un’interfaccia a riga di comando (CLI) per le ricerche offline e un’analisi riproducibile.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv