Ricerca
TabFM: un modello fondazionale zero-shot per dati tabellari
L’apprendimento automatico su dati tabellari si basa in genere su procedure specifiche per ciascun dataset: per ogni compito si addestrano ensemble di alberi o si avviano da zero ricerche AutoML. Pres

- arXiv
- 2609.37959
- Pubblicato
- 2026-09-29
- Autori
- Weihao Kong, Erez Louidor Ilan, Shuxin Nie, Taman Narayan, Rajat Sen, Yichen Zhou, Deqing Fu, Samet Oymak, Abhimanyu Das
Abstract degli autori
L’apprendimento automatico su dati tabellari si basa in genere su procedure specifiche per ciascun dataset: per ogni compito si addestrano ensemble di alberi o si avviano da zero ricerche AutoML. Presentiamo TabFM, un modello fondazionale per dati tabellari con 400 milioni di parametri che affronta la predizione supervisionata come apprendimento in contesto. TabFM produce previsioni zero-shot calibrate con un’unica propagazione in avanti, senza adattamenti specifici per il compito. Addestrato interamente su tabelle sintetiche generate da modelli causali strutturali, TabFM apprende rappresentazioni generali dei dati tabellari che si trasferiscono zero-shot a compiti reali. Su tutti i 51 dataset benchmark di TabArena (38 di classificazione e 13 di regressione), TabFM in modalità zero-shot si colloca al primo posto tra i modelli fondazionali per dati tabellari nelle configurazioni predefinite e supera le pipeline AutoML ottimizzate. Due estensioni basate sugli stessi pesi congelati migliorano ulteriormente le prestazioni sia nella classificazione sia nella regressione: l’espansione multivista delle caratteristiche con ensembling e calibrazione a posteriori (TabFM+), e l’elaborazione dei dati e il feature engineering specifici per ciascun dataset, guidati da un LLM (TabFM-Auto).