追蹤 Dharma AI 的讀者都知道,我們將專業化視為高效 AI 系統的關鍵原則之一,它影響著成本、效能、可靠性乃至主權等各個層面。鮮少有研究能像 Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 於 2026 年發表的論文那樣,嚴謹地闡述這一論點。

在本文中,我們將探討並詮釋 Goldfeder 等人於 2026 年發表的論文《AI 必須透過超人類適應性智慧擁抱專業化》中的觀點。這篇論文的整合性論點,涵蓋了最佳化理論、生物學、組織經濟學和機器學習,為接下來的討論提供了證據結構和思想基礎。本文的框架、組織和編輯綜合皆由 Dharma 提供。

一般的預期很合理:隨著 AI 系統能力增強,它們也應該變得更通用。更強大的能力和更廣泛的應用性似乎是天作之合,更多的資源、更好的方法和擴展的訓練,理應能產生以更高信心處理更多任務的系統。

然而,實際出現的模式卻有所不同。在任何特定領域中取得最顯著成果的系統,往往是那些最專注於該領域的系統。蛋白質結構預測的突破,來自於專為單一科學任務設計的系統。仔細檢視 AI 的歷史里程碑,會發現它們反映的是對特定領域的深度聚焦,而非廣泛的通用性。

這種模式不斷重現,跨越了不同領域、不同年代,以及幾乎毫無共通之處的架構選擇。如此一致的模式暗示著一個共同的原因,一個根本不源於 AI 研究內部的原因。

1997 年,Wolpert 和 Macready 證明了一項在 AI 架構討論中鮮少被提及的定理:沒有任何單一的通用最佳化演算法,能在所有可能的問題上都超越其他演算法。這項證明是數學性的,而非哲學性的。平均而言,在學習者可能面臨的每個可想像的問題上,所有演算法的表現都一樣好,也一樣差。

一個演算法若在某類問題分佈上表現優異,必然會在其他問題上有所犧牲。效能是被重新分配,而非倍增。實際的啟示很直接:「一個演算法的成功,在於它能很好地適應目標問題。」這項定理並非說通用性不可能,而是說通用性並非效能優勢。實現卓越效能的一致結構性途徑是集中:以廣度換取適配性。

當有限資源納入考量時,這一點會變得更加清晰。任何真實系統都在限制下運作,有限的運算資源、有限的資料、有限的開發時間。在有限的能量下,將可用資源導向學習有限任務集的方法,將會優於將相同資源分散到無限範圍的方法。算術是無情的:隨著任務集無限擴大,每個任務可用的資源將趨近於零。在有限資源下,普遍覆蓋和有意義的效能之間存在直接的衝突。

這項定理所指向的結論並非通用性不好。它更為狹隘且更具操作性:正如論文所述,「普遍通用性是一個理論概念,但在實際層面它是一個神話。」在真實限制下能存活下來的,不是試圖包辦一切的系統,而是能適應其目標的系統。數學將此確立為一種預測,而非偏好。這個預測是否在最佳化理論之外的世界中成立,則是另一個問題。

在最佳化理論為其命名之前,另外兩個領域已經得出了相同的預測。正如論文所描述的生物學案例:在一個生態位中的每一次效能提升,都會在其他地方付出代價。通才攜帶的特徵適合多種環境,但對任何一種環境都不是最佳的,能力過於分散,無法在任何特定條件下佔據主導地位。

沒有不帶有取捨的效能提升;投入一種能力的資源,就無法用於另一種能力。選擇偏好與當地條件匹配的設計,而非那些為所有可能環境提供統一覆蓋的最佳化設計。存活並繁殖的生物並非能力最通用的,而是最能特定匹配環境的。經過演化時間尺度累積的結果,並非通才佔據主導地位,而是專才填補了生態位。

正如論文所述:「專業化並非生物學的偶然,它是有限資源、相互競爭的目標以及獎勵在演化相關挑戰中表現優異的環境,所導致的可預測結果。」競爭市場透過不同的方式遵循相同的動態。未能達到效能門檻的組織和策略會被淘汰,不是透過滅絕,而是透過退出、撤資以及被更匹配的替代方案取代。

競爭充當一種選擇機制:它會放大有效的策略,並淘汰無效的策略。這種機制與生物選擇毫無共通之處,沒有遺傳、沒有突變、沒有演化時間尺度。選擇的單位不是生物體,而是組織、產品、策略。然而,結構性壓力是相同的:有限的資源、效能要求,以及系統性地淘汰那些過於廣泛分佈而無法在關鍵領域表現卓越的實體。當效能標準清晰且一致時,集中化的能力會超越分散化的能力。

演化和市場透過完全不同的機制運作,不同的時間尺度、不同的選擇單位、不同的遺傳機制。然而,在資源壓力下,兩者都產生了相同的結果:適配性優於廣度。這項定理預測了這一點。生物學和市場獨立地達到了這一結論。當第三個領域透過完全不同的方式得出相同的發現時,這種模式就不再像一個定理,而開始像是一種關於受限系統行為的更普遍的現象。

相同的模式也出現在機器學習領域,它並非源於最佳化理論,而是透過建構系統和觀察其改進過程的累積經驗而得出的。最明顯的形式是負向遷移(negative transfer):當一個系統在多個任務上訓練時,由於這些任務相互競爭而非合作,導致效能出現可測量的下降。當任務共享結構時,共同訓練會有所幫助。但當任務爭奪表徵能力,或在訓練期間施加衝突的梯度時,單一任務的效能就會低於專用系統所能達到的水準。

廣度帶來的收益變成了深度的代價。這是將有限能力分配給相互衝突的任務所導致的已記錄後果。專才由於沒有這種競爭,因此無需付出這個代價。前沿模型的架構提供了另一種形式的證據。專家混合(Mixture-of-experts)系統實現其廣度,並非透過所有參數的統一通用性,而是透過將每個輸入路由到網路中一個專門的子集,為不同的任務啟動不同的專家。

論文作者將此解讀為一種結構性讓步:一個旨在通用的系統,透過內部恢復專業化來實現其成果。這是一種論證性的解釋,而非已證明的定理,這些架構最初是為計算效率而設計的,它們對通用性限制的暗示是一種合理的推論,而非明確的意圖。但這是一個值得注意的觀點:最有能力的通用系統透過在內部執行專用系統設計時所做的事情來達到其效能。

最清晰的歷史案例也遵循相同的邏輯。AlphaFold 透過針對蛋白質結構預測這一特定任務,採用任務專屬的架構和訓練選擇,實現了飛躍性的進步。它的成就來自於更狹窄的焦點,而非更廣泛的覆蓋。論文將 AlphaFold 作為一個典型案例,並非證明所有專業化系統都能達到同等收益,而是作為該機制一個異常清晰的例證。

這種機制已反覆出現:論文指出,AI 里程碑的歷史經常反映的是對特定領域的深度聚焦,而非廣泛的能力,即使結果看起來像是通用智慧的展示。三個不同的領域。三種不同的機制。相同的發現。

如果不討論 AI 研究中最常被引用的觀察之一,這幅圖景將是不完整的。Sutton 的「苦澀教訓」(Bitter Lesson)認為,依賴領域知識的方法,會持續被那些能擴展運算規模的方法所超越。從表面上看,這似乎使專業化的論點變得複雜:如果規模和通用性最終會勝出,那麼專業化可能只是在資源受限下的一種有用啟發式,而隨著運算成本降低,這些限制將會緩解。

這個反對意見基於兩個不同概念的混淆。領域知識指的是手動編碼的特徵、工程化的先驗知識以及旨在讓系統洞察特定領域的規則。「苦澀教訓」針對的是這一點,這樣做是正確的。隨著規模的增加,那些編碼了明確領域知識的系統一直被超越。

領域專業化則不同:它是指將系統的資源、架構和訓練導向有限的任務集,而非廣泛分佈。這不是關於領域知識的編碼,而是關於範圍的決定。論文精確地劃分了兩者的界線:「領域知識的有用性遞減,與領域專業化的有用性是不同的。隨著規模擴展,我們將需要更少關於蛋白質的知識來建構一個能進行蛋白質摺疊的系統;然而,這樣的系統仍然會受益於專注於蛋白質本身。」

規模擴展改變了系統能從資料中學習的內容。它沒有改變將資源集中於有限任務集,是否會優於將其分散到無限範圍。「苦澀教訓」和專業化論點在不同的維度上運作,前者描述知識應如何獲取,後者描述系統應指向何處。兩者可以同時成立。規模擴展改變了系統學習的機制;它並沒有消除使適配性比廣度更有價值的限制。

橫跨四種分析傳統,相同的模式透過不同的途徑浮現。這不是一個需要解釋的巧合,而是證據本身。當有限資源遇到選擇壓力時,無論是在最佳化問題、生態系統、市場,還是訓練運行中,適配性始終勝過廣度。具體機制不同。時間尺度不同。選擇單位不同。但結構動態是相同的,並且產生相同的結果。這項定理並未導致生物學中的這種模式。生物學也未導致市場中的這種模式。兩者皆未導致機器學習中的這種模式。它們都面臨著相同的潛在限制。