The Pulse
L’AISI del Regno Unito pubblica i risultati delle valutazioni tramite EvalEval
L’Istituto per la sicurezza dell’IA del Regno Unito condivide risultati verificati delle valutazioni, metodi e informazioni di configurazione tramite l’infrastruttura aperta di EvalEval.

AI.info Team ·
L’Istituto per la sicurezza dell’IA del Regno Unito utilizza l’infrastruttura di EvalEval per condividere apertamente i risultati delle valutazioni, dando ai ricercatori accesso a risultati verificati insieme al contesto e alle informazioni di configurazione necessari per interpretarli.
L’annuncio, pubblicato il 22 settembre 2026, segna una nuova fase della collaborazione tra AISI e la EvalEval Coalition. AISI mette a disposizione, ove opportuno, metodi e risultati delle valutazioni comunicati pubblicamente, attraverso le Evaluation Cards. La piattaforma aperta riunisce i risultati delle valutazioni e le informazioni necessarie per interpretarli in una struttura comune.
AISI ed EvalEval avevano già collaborato a una ricerca avviata durante un workshop congiunto tenutosi in parallelo a NeurIPS 2025. Anche il contributo dell’istituto ha contribuito a definire lo schema Every Eval Ever, il formato di rendicontazione condiviso alla base del progetto.
«Siamo entusiasti di questa adozione e non vediamo l’ora di standardizzare ulteriormente e condividere le valutazioni con AISI e altre organizzazioni che si occupano di valutazione dell’IA.»
— EvalEval Coalition, comunità di ricerca
Cinque benchmark, sei modelli di frontiera
La pubblicazione include risultati verificati, informazioni di contesto e di configurazione per cinque benchmark utilizzati nell’esperimento principale dello studio: HealthBench, FrontierMath, Humanity’s Last Exam, SWE-Bench Pro e Terminal-Bench 2.0.
I risultati riguardano sei modelli di frontiera: Claude Opus 4, Claude Opus 4.5, Claude Opus 4.6, GPT-5, GPT-5.2 e GPT-5.4. AISI condivide anche i risultati di due valutazioni informatiche correlate, Cyber CTFs e The Last Ones, che utilizzano un insieme di modelli diverso e parzialmente sovrapposto.
I dati accompagnano lo studio di AISI, Come la potenza di calcolo in inferenza influenza la valutazione dei modelli LLM di frontiera. Lo studio esamina come le prestazioni nei benchmark dipendano dalla potenza di calcolo impiegata in fase di inferenza e dal protocollo utilizzato per condurre una valutazione.
Un esempio contenuto nella pubblicazione riguarda Humanity’s Last Exam. Il materiale pubblicato mostra che le prestazioni cambiano a seconda del protocollo di valutazione e della potenza di calcolo in inferenza. Quando i modelli ricevevano da un oracolo un riscontro sulla correttezza dopo ogni tentativo, continuavano a risolvere altri compiti all’aumentare del numero di token utilizzati.
Perché le modalità di valutazione cambiano il risultato
I risultati delle valutazioni sono spesso comunicati con formati, piattaforme e canali diversi, talvolta senza informazioni sufficienti per riprodurli. La formulazione dei prompt, l’accesso agli strumenti, i limiti di token, le regole di riscontro, le procedure di valutazione e la quantità di potenza di calcolo impiegata in inferenza possono tutti influire sul significato di un risultato misurato.
La piattaforma di EvalEval è pensata per conservare questi dettagli, anziché ridurre una valutazione a un singolo numero. Le Evaluation Cards combinano metadati sui benchmark, dati sulle esecuzioni delle valutazioni e metadati sui modelli, creando schede che aiutano gli utenti a capire se risultati apparentemente simili siano stati ottenuti in condizioni sostanzialmente diverse.
Ripetere una valutazione su larga scala può essere costoso o impossibile. I dati di configurazione pubblici non possono sostituire una nuova esecuzione, ma possono aiutare i ricercatori ad analizzare più da vicino i singoli studi, confrontare i protocolli e capire in che modo le scelte di configurazione possano influire sulle prestazioni riportate.
EvalEval vuole un archivio condiviso dei test sull’IA
Il progetto Every Eval Ever fornisce lo schema di rendicontazione, mentre Evaluation Cards presenta i risultati e i metadati associati in una forma consultabile. La coalizione invita gli sviluppatori di modelli a riportare risultati verificati delle valutazioni, gli sviluppatori di valutazioni a inviare dati sui benchmark e sulle esecuzioni usando lo schema Every Eval Ever, e i ricercatori che si occupano di valutazione, governance e politiche pubbliche a esplorare le schede per benchmark o modello.
Questo accordo inserisce il lavoro di AISI in una raccolta più ampia di valutazioni, invece di lasciare ogni risultato confinato in uno studio autonomo o in un rapporto istituzionale. I ricercatori possono confrontare i risultati relativi a un benchmark o a un modello ottenuti con configurazioni diverse e verificare in che misura le differenze possano dipendere dalle scelte di protocollo.
Per AISI, la pubblicazione offre un archivio pubblico di alcune attività di valutazione, senza sostenere che sia possibile rendere pubblici tutti i metodi o i risultati interni. L’annuncio afferma che i dati condivisi comprendono i cinque benchmark dell’esperimento principale dello studio e due valutazioni informatiche correlate.
Il risultato immediato è un insieme di valutazioni di modelli di frontiera corredate da informazioni che consentono ad altri ricercatori e professionisti di esaminare le condizioni alla base dei punteggi. EvalEval afferma che, man mano che altri valutatori adotteranno lo schema Every Eval Ever, i confronti aperti potranno favorire una metaricerca più ampia e affidabile.