大型語言模型(LLM)是 ChatGPT、Claude 和 Gemini 等生成式 AI 聊天機器人的基礎,它們能生成驚人地像人類的文字和圖像。
然而,這些模型卻在一個看似它們擅長的領域,分析結構化數據,上遇到困難。一種新型的生成式 AI 正準備改變這種局面。
儘管你可以讓常用的聊天機器人解決棘手的數學問題、審閱複雜的法律文件、創作流行歌曲或製作精美的 PowerPoint 投影片,但只要給它一個稍大的表格,它就完全不知所措了。
對於大多數公司和組織而言,最重要的數據都儲存在試算表中。無論是銀行的交易日誌、行銷公司的網站指標、臨床試驗參與者的生命徵象,還是大型強子對撞機等原子對撞機產生的大量質子碰撞資訊,這些結構化的、行與列的數據驅動著世界,而 LLM 卻無法有效處理它們。
AI 新創公司 Fundamental 正在開創一種新型的 AI 基礎模型,稱為大型表格模型(LTM),以填補這一空白。Fundamental 於 2026 年 2 月 5 日結束隱身模式,獲得 2.75 億美元資金,並推出專為表格數據打造的模型 NEXUS。目前,該模型正被 Amazon Web Services 等公司採用,同時其他公司也競相開發自己的 LTM。
LLM 為何難以處理試算表
阿姆斯特丹的資深 AI 研究員 Boris van Breugel 認為,結構化數據之所以較少受到關注,部分原因在於人類的偏見。他表示:「人們喜歡看圖片、影片和 ChatGPT 的回應,但表格數據卻遠遠落後,因為看數字並不有趣。」
van Breugel 解釋說,不同的表格數據集也很難進行比較,他曾在 2024 年共同撰寫了一篇關於此主題的預見性論文。大多數語言具有相似的語義,這使得 LLM 非常適合在大量文本數據上進行訓練,但 van Breugel 認為,在變數差異很大的表格上訓練單一表格模型要困難得多。
此外,語言本質上是序列性的(音樂、圖像和影片也是如此),改變句子中單詞的順序可能會改變或完全破壞其意義。然而,試算表中的結構化數據並非序列性的,你可以交換列的順序或調整行的位置,但數據的潛在事實意義保持不變。
這種與線性順序的獨立性,與 LLM 預測線性序列中下一個值的基本目的不相容。Fundamental 的執行長 Jeremy Fraenkel 表示:「對於 LLM 來說,即使輸入稍有變化,你也會得到不同的輸出。」他補充說:「這對 LLM 來說很好,而且通常是理想的,但當你預測一筆交易是否為詐欺時,你希望無論如何,預測結果都是相同或確定的。」
Fundamental 的 LTM 開發
目前的表格數據解決方案僅限於機器學習演算法,例如 XGBoost,這些演算法已存在超過 15 年,並被全球組織廣泛使用。這些被稱為梯度提升決策樹的演算法,需要數據科學家針對每個用例花費數月時間進行訓練和優化。
相較之下,NEXUS 和其他新興的 LTM 都是基礎模型,它們利用從多樣化數據庫預訓練中累積的知識。這使得它們能夠應用於各種不同的預測任務,且只需最少量的客製化特徵工程或針對特定任務的模型建構。
與主要建模 token 序列的 LLM 不同,LTM 直接建模表格數據的結構。它們共同學習每個條目的數值、其代表的意義以及它與其他條目之間的關係。例如,想像雜貨庫存表中香蕉的一個條目:LTM 不僅能理解其數值(例如 500),還能理解該條目代表當前的香蕉庫存數量、其類別(農產品),以及將該條目與列中其他數據連結起來的統計特性。這種上下文理解能力使得對結構化數據的推理和預測更加準確。
根據 Fraenkel 的說法,Fundamental 在開發 NEXUS 時面臨的最大挑戰之一是獲取正確的訓練數據。與豐富且結構大致統一的自然語言不同,表格數據相對難以找到,其中大部分數據是敏感或專有的,而且種類繁多。例如,生物學數據集和金融數據集之間幾乎沒有相似之處。這些因素的結合意味著 Fundamental 需要投入大量資源來建立龐大的訓練集。
Fraenkel 表示:「我們透過合作夥伴關係和授權獲取的專有數據集、高品質的公共和開源數據集,以及擴展訓練語料庫多樣性和覆蓋範圍的數據增強技術,在數十億個表格上預訓練了 NEXUS。」但他強調 NEXUS 並未在客戶數據上進行訓練。事實上,它是一個機密計算平台,這意味著 Fundamental 無法實際存取客戶數據,更不用說在其上進行訓練了。
這項功能很可能是在六月時,Amazon Web Services (AWS) 將 NEXUS 嵌入 Amazon SageMaker 的關鍵考量。Amazon SageMaker 被廣泛認為是安全機器學習的預設作業系統。這使得 NEXUS 能夠處理許多客戶通常敏感的數據,這與 LLM 的方法形成對比,LLM 需要將數據導入模型。
Fraenkel 說:「我們與 Amazon 建立了第一方合作夥伴關係,這意味著我們的模型就像是原生的 AWS 解決方案一樣存在。」他補充道:「隨著時間的推移,目標是擴展這類合作關係,讓終端用戶無論在哪裡進行預測,都能真正存取他們的數據。」
數據分析的未來
儘管 Fundamental 至少在企業應用方面取得了領先地位,但該公司並非唯一一家追求基礎 LTM 的公司。三月,提供詐欺和金融犯罪預防服務的 Feedzai,以及信用卡公司 Mastercard,分別推出了專注於金融領域的類似專有技術。
隨後,六月下旬,Google 推出了自己的基礎競爭產品 TabFM,該產品完全在數億個合成數據集上進行訓練。機器學習研究人員也緊隨其後,FlexTab、TabICL 和 iLTM 只是過去一年研究社群開發的眾多 LTM 中的三個,所有這些都旨在將 LLM 的成功帶入表格領域。
對於所有參與者來說,發展方向是明確的。van Breugel 表示:「如果未來大多數數據處理和分析不是透過自動化系統完成,無論是 LLM、LTM 還是兩者的某種組合,我都會感到非常驚訝。」他補充說:「大多數人並不一定喜歡做數據分析,而這些系統將能夠做得更好。」
Fraenkel 對此表示贊同。他說:「我認為 LLM 和 LTM 之間的關係有點像人腦:左腦擅長推理、理解和總結文本,而右腦則非常擅長理解數字、統計數據和模式。」他總結道:「但只有將兩者結合起來,你才能真正獲得更強大的能力。」



