Vai al contenuto
AI.info

Ricerca

WhatWorkedBench: valutare la comprensione sperimentale negli agenti di IA

Gli agenti di ricerca in IA hanno bisogno di conoscenze affidabili su come gli esperimenti modificano i risultati. Presentiamo WhatWorkedBench, uno strumento per misurare la comprensione sperimentale:

WhatWorkedBench: valutare la comprensione sperimentale negli agenti di IA
arXiv
2609.27490
Pubblicato
2026-09-23
Autori
Jingjie Ning, Xueqi Li, Yibo Kong, Dongting Li

Abstract degli autori

Gli agenti di ricerca in IA hanno bisogno di conoscenze affidabili su come gli esperimenti modificano i risultati. Presentiamo WhatWorkedBench, uno strumento per misurare la comprensione sperimentale: l’accuratezza delle previsioni sulle modifiche ai componenti dopo una sperimentazione con budget limitato. Gli agenti esaminano il codice, selezionano le misurazioni e inviano una superficie di risposta, ovvero una tabella che prevede i punteggi per ogni configurazione delle impostazioni dei componenti. L’esecuzione esaustiva su CPU fornisce gli effetti di riferimento delle modifiche a ciascun componente, mantenendo fissi gli altri. Questi effetti rilevano le combinazioni di modifiche in 36 task provenienti da 30 fonti di dati e 8 tipi di workflow, con 1248 record di configurazione. La valutazione principale combina 4.206 record di controllo numerico, relativi a tutte le otto famiglie, e 108 episodi di agenti, relativi alle sei famiglie originali. Con otto nuove misurazioni, la regressione ridge degli effetti a coppie seleziona una configurazione ottimale in 15 delle 22 fonti e, in tre di esse, mantiene ogni errore sugli effetti entro il 10% dell’intervallo dei punteggi. Adattare un processo gaussiano (GP) alle stesse osservazioni degli agenti aumenta il recupero degli effetti — l’accuratezza rispetto all’entità reale dell’effetto — da 0,632 a 0,698 nella coorte Flash originale e da 0,621 a 0,720 in una coorte aggiuntiva. In sei submission completate per il rilevamento del battito e i grafi, il GP applicato alle stesse osservazioni aumenta il recupero macro per famiglia da 0,303 a 0,455. In sei workflow con sei opzioni binarie e 20 nuove misurazioni, codificare le equivalenze nel codice, cioè le configurazioni con comportamento identico, aumenta il recupero del GP da 0,248 a 0,462. WhatWorkedBench sostiene la ricerca sugli agenti sperimentali, la progettazione adattiva degli esperimenti, l’inferenza numerica e l’uso della struttura dei programmi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv