Vai al contenuto
AI.info

Ricerca

CroissantMiner: estrazione e validazione automatizzate dei metadati Croissant per i dataset di ML

Croissant si è affermato come standard per i metadati dei dataset leggibili dalle macchine, ma compilare i suoi campi richiede ancora molto lavoro e un’attenta lettura della documentazione che accompa

CroissantMiner: estrazione e validazione automatizzate dei metadati Croissant per i dataset di ML
arXiv
2610.07132
Pubblicato
2026-10-05
Autori
Berke Arda, Ahmetcan Yavuz, Paul Gerry, Sebastian Lobentanzer, Nobin Sarwar, Joan Giner-Miguelez, Kongtao Chen, Luyao Zhang, Mrinmaya Sachan, Mubashara Akhtar

Abstract degli autori

Croissant si è affermato come standard per i metadati dei dataset leggibili dalle macchine, ma compilare i suoi campi richiede ancora molto lavoro e un’attenta lettura della documentazione che accompagna i dataset. Presentiamo il primo benchmark che consente di valutare dall’inizio alla fine l’estrazione dei metadati secondo uno schema standard della comunità. Il benchmark comprende 602 articoli, di cui 102 con annotazioni gold validate da persone e 500 con annotazioni silver generate da LLM, e copre l’intero schema Croissant, sia nei campi principali sia in quelli di Responsible AI (RAI). Con questo benchmark valutiamo diversi sistemi di estrazione, dai modelli di frontiera a quelli a pesi aperti e alle architetture agentiche, usando un sistema di valutazione a due livelli che combina punteggi basati su regole e un giudice LLM selezionato tramite un audit condotto da persone. Rileviamo che l’estrazione in un solo passaggio supera sistematicamente le quattro architetture agentiche che valutiamo: per tutti i modelli di base, queste varianti scomposte ottengono una precisione inferiore rispetto a un unico passaggio con il contesto completo. Il divario maggiore riguarda i campi RAI a testo esteso, che richiedono di sintetizzare e interpretare informazioni sparse in un articolo anziché copiarle da un unico punto: un compito in cui i sistemi attuali sono ancora lontani dall’essere affidabili. Rendiamo pubblici il benchmark, il codice di valutazione, l’audit del giudice, una demo dal vivo e una classifica aperta a nuovi sistemi.

Il riassunto di questo paper è disponibile solo in inglese: leggilo nella pagina inglese.

Leggi il paper originale su arXiv