Ricerca
I punteggi da soli non dimostrano una scoperta: il Discovery Certification Protocol per verificare gli agenti di ricerca basati sull’IA
Gli agenti di ricerca basati sull’IA combinano conoscenze pregresse, fonti pubbliche e feedback sperimentale per produrre risultati utili. Il Discovery Certification Protocol (DCP) trasforma le afferm

- arXiv
- 2609.09219
- Pubblicato
- 2026-09-07
- Autori
- Jingjie Ning, Shanshan Zhong, Xiaochuan Li, Ji Zeng
Abstract degli autori
Gli agenti di ricerca basati sull’IA combinano conoscenze pregresse, fonti pubbliche e feedback sperimentale per produrre risultati utili. Il Discovery Certification Protocol (DCP) trasforma le affermazioni su questi risultati in test eseguibili di recupero e di feedback. Gate 1 verifica che vi sia un miglioramento utile in una valutazione sigillata. Gate 2 fornisce ad agenti comparabili le informazioni iniziali registrate e i contenuti Web osservati, senza rivelare la cronologia della ricerca oggetto della verifica. Ogni metodo valido che raggiunge l’obiettivo numerico costituisce una prova di recupero e attiva il veto di Core. DCP Core richiede controlli adeguati, nessun recupero osservato e un limite sul recupero calcolato su un campione finito in un singolo nuovo episodio registrato. Gate 3, facoltativo, misura l’effetto medio del feedback veritiero rispetto a una specifica politica neutra, a partire da un checkpoint condiviso. DCP Evidence aggiunge questo effetto dopo una calibrazione indipendente del caso nullo e la registrazione di un margine d’effetto. Due verifiche controllate applicano l’intero protocollo all’ottimizzazione di SQLite e al controllo di un catalizzatore virtuale, con modelli diversi. Ciascuna ha prodotto zero recuperi in 96 episodi, con un limite superiore di 0,0468. Ciascuno studio a coppie ha registrato 30 recuperi con feedback veritiero e zero recuperi con feedback neutro, mentre gli studi sul caso nullo di 60 coppie hanno superato la verifica. Ulteriori casi mettono alla prova le decisioni Core, recovered e audit-incomplete. Un verificatore deterministico, privo di LLM, riproduce le decisioni a partire da prove fissate. DCP offre un linguaggio comune per descrivere i risultati utili, i percorsi alternativi e gli effetti del feedback nella ricerca sull’IA.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv