自從我們推出 TimesFM 以來,時間序列預測的處理方式已發生巨大轉變。現在,我們將相同的「零樣本」邏輯應用於表格資料。我們介紹 TabFM,這是一個專為表格資料設計的新型基礎模型,已直接整合到 BigQuery ML 中,以簡化分類和迴歸的工作流程。
表格資料是企業資料基礎設施的骨幹,驅動著大量關鍵的預測性機器學習應用。從預測客戶流失到識別金融詐欺,表格迴歸和分類任務無處不在。多年來,AdaBoost、XGBoost 和隨機森林等監督式樹狀演算法,一直主導著這個領域,為結構化資料提供了穩健的效能。
然而,部署這些傳統模型的生命週期存在著顯著的瓶頸。將 XGBoost 模型擬合到新資料集,不僅僅是一個簡單的 .fit() 步驟;它總是需要繁瑣的人工努力。資料科學家必須投入無數時間進行大量的超參數優化和領域特定特徵工程,才能從原始資料中提取可靠的訊號。
另一方面,機器學習領域的最新進展,特別是大型語言模型(LLM)的演進,改變了我們與新任務互動的方式。LLM 透過上下文學習(ICL)展示了零樣本預測的卓越能力。這項技術讓預訓練模型透過在輸入上下文中提供範例和指令來學習新任務,而無需更新任何底層模型權重。
今天,我們介紹 TabFM,這是一個專為表格資料分類和迴歸設計的基礎模型。透過將表格預測視為 ICL 問題,TabFM 消除了手動模型訓練、超參數調校和複雜特徵工程的需求。我們很高興分享這種方法如何讓使用者在單次前向傳播中,就能對以前未見的表格產生高品質的預測。TabFM 現已在我們的 Hugging Face 和 GitHub 儲存庫上提供。
傳統的機器學習範式依賴於更新特定於給定資料集分佈的模型參數。相比之下,ICL 範式完全繞過了這一點。TabFM 不會為每個新任務經歷傳統的訓練階段,而是將整個資料集(包括歷史訓練範例和目標測試行)作為一個統一的提示詞。模型在推論時直接從這個上下文中學習解釋列和行之間的關係。
然而,將 ICL 應用於表格資料並不像對自然語言進行詞元化那麼簡單。標準語言模型處理一維、有序的序列,但表格本質上是二維且無序的:交換兩行或兩列不會改變資料的底層含義。為了有效處理這些多樣的表格結構,同時實現可擴展的零樣本預測,TabFM 將 TabPFN 和 TabICL 等架構的優勢,綜合為一種新穎的混合設計。這種架構依賴於三個關鍵機制:
交替的行和列注意力:首先,原始表格透過多層注意力模組進行處理。類似於 TabPFN,這一步驟在列(特徵)和行(範例)之間應用交替注意力。透過在這兩個維度上持續關注,模型學習到豐富的表示,這些表示自然地捕捉了複雜的特徵交互和依賴關係。這種深度上下文化有效地完成了資料科學家原本需要繁瑣手動特徵工程的繁重工作。
行壓縮:在這種上下文化之後,每個單獨行的豐富、交叉注意資訊被壓縮成單一的密集向量表示。
上下文學習(ICL):最後,一個專用的 Transformer 在這個壓縮嵌入序列上運行。採用 TabICL 的高效方法,對這些壓縮的行向量(而不是原始、未壓縮的網格)執行注意力,大大降低了計算成本。這確保了預測步驟即使對於更大的資料集,也能保持高度的計算效率。
大規模合成資料訓練:建立基礎模型的典型方法是使用在大量多樣化資料上訓練的高容量神經網路。然而,表格機器學習的一個主要障礙是,高品質、多樣化的表格資料集,特別是反映真實工業資料分析所需的大型表格,在開源領域極為稀缺。工業表格通常包含專有架構和敏感資訊,使其無法用於廣泛的預訓練。
由於合成表格可以任意生成,它們實際上是預訓練如此大規模基礎模型的唯一可行選擇。因此,TabFM 完全在數億個合成資料集上進行訓練。這些資料集是使用結構因果模型(SCM)動態生成的,其中包含了各種隨機函數。這種大規模的合成生成捕捉了真實世界表格資料中普遍存在的各種分佈和複雜特徵關係。因此,該模型能夠很好地泛化到未見過的真實世界表格,正如我們在下面的基準測試中所示。
效能與基準測試:為了嚴格測試 TabFM 對抗現有最先進的方法,我們在 TabArena 上對其進行了評估。TabArena 是一個動態基準測試系統,它根據一對一的勝率計算 Elo 分數。這項全面的評估涵蓋了 38 個分類資料集和 13 個迴歸資料集,樣本數量從 700 到 150,000 不等。
如下圖所示的效能圖,我們對模型的兩種不同配置進行了基準測試:
TabFM:這代表了模型的開箱即用能力。預測在單次前向傳播中生成,無需調校或交叉驗證。
TabFM-Ensemble:此配置透過整合交叉特徵和 SVD(奇異值分解)特徵,進一步提升了效能。我們使用非負最小平方法求解器計算 32 路集成模型的最佳權重。對於分類任務,此變體還包含 Platt 縮放作為額外的校準步驟。如需完整的 TabArena 基準測試結果,包括詳細的每折指標和針對特定基準模型的一對一勝率,請訪問我們的 GitHub 頁面。
結論:透過將表格預測重新定義為上下文學習問題,TabFM 利用混合注意力架構和大規模合成訓練資料,自然地捕捉複雜的特徵交互。這種方法成功消除了手動特徵工程、超參數優化和重複模型訓練等傳統瓶頸,並持續超越經過大量調校的業界標準監督式演算法。TabFM 將現代基礎模型的開箱即用便利性,直接帶入表格機器學習工作流程,使實踐者能夠在單次前向傳播中生成高度準確的預測。
為了使其更易於使用,TabFM 正直接整合到 Google BigQuery 中。在未來幾週內,使用者將能夠在 BigQuery 中使用簡單的 AI.PREDICT SQL 指令,執行進階的迴歸和分類任務,無需機器學習專業知識。
致謝:此專案由 Erez Louidor Ilan、Taman Narayan、Shuxin Nie、Rajat Sen、Yichen Zhou、Joe Toth、Deqing Fu 和 Samet Oymak 共同完成。我們感謝 Kimberly Schwede 設計了圖形。



