Ricerca
AutoDataBench: un banco di prova incentrato sui dati per accelerare la ricerca automatizzata
I benchmark esistenti per la ricerca automatizzata spesso intrecciano diverse fonti di miglioramento, tra cui framework di addestramento, iperparametri, risorse di calcolo e dati. Diventa così diffici

- arXiv
- 2609.40097
- Pubblicato
- 2026-09-30
- Autori
- Ruifeng Yuan, Yizhi Li, Yaxin Du, Fengyu Cai, Yiqi Liu, Hou Pong Chan, Chenghua Lin, Yun Chen, Jian Yang, Bryan Dai, Pinyan Lu, Chenghao Xiao
Abstract degli autori
I benchmark esistenti per la ricerca automatizzata spesso intrecciano diverse fonti di miglioramento, tra cui framework di addestramento, iperparametri, risorse di calcolo e dati. Diventa così difficile attribuire a specifiche capacità di ricerca il fatto che un agente all’avanguardia superi un altro. In questo lavoro isoliamo e valutiamo sistematicamente l’intelligenza dei dati: la capacità di un agente di comprendere, manipolare e migliorare i dati che determinano le capacità di un modello. Presentiamo AutoDataBench, un banco di prova controllato basato su un quadro concettuale dell’intelligenza dei dati che comprende diagnosi, organizzazione e costruzione dei dati. Lo realizziamo attraverso tre compiti di ottimizzazione accuratamente selezionati, mantenendo fissi i fattori non legati ai dati. Per l’uso degli strumenti, il recupero delle informazioni e l’iniezione di conoscenze, valutiamo la capacità degli LLM all’avanguardia di migliorare i dati di addestramento attraverso esperimenti iterativi, entro limiti di risorse specifici per ciascun compito. Oltre alle prestazioni nell’ottimizzazione, ci chiediamo: gli LLM comprendono gli effetti dei propri interventi sui dati? Confrontiamo le previsioni formulate prima dell’addestramento con i risultati osservati per cercare prove di un ragionamento sugli effetti dei dati che vada oltre i tentativi ed errori, ed esaminiamo se il feedback iterativo aiuti gli LLM a comprendere meglio come le modifiche ai dati di addestramento incidano sulle prestazioni del modello. Infine, mostriamo che il riutilizzo delle traiettorie di AutoDataBench per l’addestramento intermedio migliora le prestazioni nei compiti di programmazione a valle, evidenziandone il valore sia per valutare l’intelligenza dei dati sia per generare dati di addestramento di alta qualità. Codice e risorse sono disponibili all’indirizzo https://github.com/AutoDataBench/AutoDataBench.
Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.
Leggi il paper originale su arXiv