Tabuláris adatok a vállalati adat‑infrastruktúra gerincét alkotják, és sok kulcsfontosságú prediktív gépi tanulási alkalmazást táplálnak — ügyfél lemorzsolódás előrejelzése vagy pénzügyi csalás felismerése például tipikusan táblázatos regressziós és klasszifikációs feladatok. Hosszú ideje a felügyelt, faalapú algoritmusok (AdaBoost, XGBoost, random forests stb.) uralták ezt a területet, mivel megbízható teljesítményt nyújtanak strukturált adatokon.
Ugyanakkor ezek telepítési élettartama jelentős idő- és munkaigénnyel jár: egy új adathalmazra illesztett XGBoost‑modell nemcsak egy .fit() hívás; adattisztítás, domain‑specifikus feature‑engineering és kiterjedt hiperparaméter‑hangolás szükséges ahhoz, hogy a nyers adatokból megbízható jel jöjjön létre.
Ezzel szemben a nagy nyelvi modellek (LLM‑ek) terén bekövetkezett előrelépések megváltoztatták az új feladatokkal való interakciót: az in‑context learning (ICL) azt mutatta, hogy egy előre betanított modell súlyainak frissítése nélkül is képes új feladatot megtanulni, ha példákat és utasításokat helyezünk a bemeneti kontextusba.
Ma bemutatjuk a TabFM‑et, egy alapmodellt, amelyet kifejezetten táblázatos klasszifikációs és regressziós feladatokra terveztek. A tabuláris előrejelzést ICL‑feladatként kezelve a TabFM megszünteti a manuális modelltréning, a hiperparaméter‑hangolás és a bonyolult feature‑mérnökség szükségességét: a korábban sosem látott táblákon egyetlen forward pass‑szal képes magas minőségű predikciókat adni. A TabFM elérhető a Hugging Face és a GitHub repóinkban.
Működési elv
A hagyományos gépi tanulási paradigma minden új adathalmazhoz modellparaméterek frissítését igényli. Az ICL‑paradigma ehelyett a teljes adathalmazt — a történeti tanuló példákat és a célsorokat együtt — egyetlen, egységes promptként kezeli, és a modell a lekérdezés idején, a kontextusból tanulja meg az oszlopok és sorok közötti kapcsolatokat.
Táblázatos adatok ICL‑re fordítása azonban nem olyan egyszerű, mint a természetes nyelv tokenizálása: a nyelvi modellek egydimenziós, sorrendelt szekvenciákat dolgoznak fel, míg a táblák kétdimenziósak és lényegük szerint sorrendfüggetlenek — két sor vagy két oszlop felcserélése nem változtatja meg az adatok jelentését. A skálázható, nulla‑shot predikcióhoz alkalmazkodó feldolgozás érdekében a TabFM egy hibrid architektúrán alapul, amely a TabPFN és a TabICL megközelítéseinek előnyeit egyesíti. A modell három kulcsmechanizmusra épül:
- Alternáló sor‑ és oszlop‑figyelem: a nyers táblát egy többrétegű attention modul dolgozza fel, amely felváltva figyel oszlopokra (feature‑ekre) és sorokra (példákra). Ezzel a két dimenzió közötti folyamatos figyelem révén a modell gazdag reprezentációkat tanul, és natívan képes megragadni összetett feature‑interakciókat és függőségeket — ezt a kontextualizációt a data scientist‑ek manuális feature‑építése nélkül végzi el.
- Sor‑kompresszió: a kontextualizált, keresztül attended információt minden egyes sorra vonatkozóan egyetlen, tömör vektorrá sűrítik.
- In‑context learning (ICL): végül egy dedikált Transformer működik ezekre a kompresszált sor‑beágyazásokból álló szekvenciára. A TabICL‑hez hasonlóan az attention itt a sorvektorokon történik, nem a nyers, kiterjedt rácson, ami jelentősen csökkenti a számítási költséget és lehetővé teszi hatékony predikciót nagyobb adathalmazok esetén.
Szintetikus adatokon történő nagyméretű tanítás
Az alapmodellek építésének tipikus receptje nagy kapacitású hálózatok tanítása változatos, nagyszámú adatokon. A táblázatos ML‑ben azonban ritkák a nyílt forráskódú, nagy és változatos, ipari méretet tükröző táblázatos adatkészletek: az ipari táblák gyakran védett sémákat és érzékeny információkat tartalmaznak. Emiatt az alapmodell előtréningjéhez gyakorlatilag egyetlen életképes megoldás marad: a szintetikus adatok.
A TabFM ezért teljes egészében több száz millió, dinamikusan generált szintetikus adathalmazon tanult. Ezeket strukturális kauzális modellekkel (SCM) hozták létre, különféle véletlenszerű függvények bevonásával, hogy lefedjék a valós világbeli táblázatoknál előforduló széles eloszlás‑ és feature‑kapcsolatváltozatosságot. Ez a nagymértékű szintetikus generálás lehetővé teszi, hogy a modell jól generalizáljon ismeretlen, valós adathalmazokra — ezt a cikkben közölt benchmarkok is alátámasztják.
Teljesítmény és benchmarkok
A TabFM-et a létező legjobb módszerekkel összehasonlítva a TabArena nevű, élő benchmark rendszeren tesztelték, amely head‑to‑head győzelmi arányok alapján számít Elo pontszámokat. A vizsgálat 38 klasszifikációs és 13 regressziós adathalmazt fedett le, amelyek mérete 700‑tól 150 000 mintáig terjed.
Két modellkonfigurációt mértek:
- TabFM: a modell „out‑of‑the‑box” képességét mutatja — predikciók egyetlen forward pass során, hangolás vagy cross‑validation nélkül.
- TabFM‑Ensemble: a teljesítményt tovább növelő variáns, amely cross‑feature‑öket és SVD (Singular Value Decomposition) feature‑öket is tartalmaz. Egy 32‑utas ensemble optimális súlyait nemnegatív legkisebb négyzet megoldóval számítják, és klasszifikáció esetén Platt‑skalázst alkalmaznak a kalibrációra.
Részletes per‑fold metrikákat és head‑to‑head győzelmi arányokat az egyes baseline modellekkel szemben a projekt GitHub‑oldalán teszik közzé.
Következtetés és integráció
A tabuláris előrejelzés ICL‑feladatként való újrafogalmazásával a TabFM hibrid attention architektúrája és a hatalmas, szintetikus előtréning lehetővé teszi az összetett feature‑interakciók natív megragadását. Ez a megközelítés megszünteti a hagyományos szűk keresztmetszeteket — a manuális feature‑engineeringet, a hiperparaméter‑optimalizációt és az ismétlődő modelltréninget — miközben konzisztensen felülmúlja a nagy erőforrással hangolt ipari felügyelt algoritmusokat.
A TabFM célja, hogy az alapmodellek „out‑of‑the‑box” kényelmét közvetlenül elhozza a tabuláris ML‑munkafolyamatokba: egyetlen forward pass‑szal lehet pontos predikciókat generálni. A TabFM‑et integrálják a Google BigQuery‑be is: a következő hetekben a felhasználók AI.PREDICT SQL parancs segítségével végezhetnek fejlett regressziós és klasszifikációs feladatokat BigQuery‑ben — gépi tanulási szakértelem nélkül.
Köszönetnyilvánítás
A projekt közös munka eredménye: Erez Louidor Ilan, Taman Narayan, Shuxin Nie, Rajat Sen, Yichen Zhou, Joe Toth, Deqing Fu és Samet Oymak. Kimberly Schwede‑nek köszönik a grafikák megtervezését.



