Vai al contenuto
AI.info

Ricerca

TabFM-Auto: pipeline autoevolutive per modelli fondazionali per dati tabellari

I modelli fondazionali per dati tabellari raggiungono un’elevata accuratezza zero-shot sui dati strutturati grazie al preaddestramento su tabelle sintetiche, ma ignorano i nomi delle colonne, le descr

TabFM-Auto: pipeline autoevolutive per modelli fondazionali per dati tabellari
arXiv
2609.37989
Pubblicato
2026-09-29
Autori
Deqing Fu, Huangyuan Su, Rajat Sen, Taman Narayan, Sujay Sanghavi, Abhimanyu Das, Weihao Kong

Abstract degli autori

I modelli fondazionali per dati tabellari raggiungono un’elevata accuratezza zero-shot sui dati strutturati grazie al preaddestramento su tabelle sintetiche, ma ignorano i nomi delle colonne, le descrizioni dei compiti e i file ausiliari che veicolano la semantica dei dataset. Gli agenti autoevolutivi di ingegneria del machine learning (MLE), invece, addestrano i modelli da zero su ogni dataset, ma la ricerca congiunta di feature, architetture e iperparametri è rumorosa e soggetta a overfitting. Presentiamo TabFM-Auto, che abbina un modello fondazionale per dati tabellari, TabFM, a un agente basato su un modello linguistico che fa evolvere la pipeline dei dati attorno a esso. Guidato dai metadati del dataset e dai risultati della validazione, TabFM-Auto perfeziona iterativamente la pulizia dei dati, la creazione delle feature, la selezione del contesto e il post-processing per ridurre gli errori di TabFM. Su tutti i 51 dataset del benchmark TabArena, cinque configurazioni di TabFM-Auto con agenti e modelli linguistici diversi occupano le prime cinque posizioni della classifica generale, e la migliore porta il punteggio di TabFM da 1785 a 2013 Elo. Le pipeline individuate si trasferiscono anche ad altri modelli fondazionali per dati tabellari i cui parametri restano fissi (+69 a +143 Elo), senza ulteriori ricerche. Nelle 8 competizioni per dati tabellari di MLE-Bench, TabFM-Auto si classifica primo assoluto tra gli agenti MLE.

Leggi il paper originale su arXiv