過去兩年,人工智慧競賽的評分標準相對簡單:模型越大、基準測試表現越好,哪家公司能聲稱領先,至少在下一次產品發表前都是如此。然而,這套評分標準現在看來已不夠全面。
隨著企業從測試 AI 轉向將其應用於實際產品和工作流程,重點不再是使用「最好」的模型,而是找到最適合特定任務、成本合理、具備所需數據並能在指定環境中運行的模型。這種轉變開啟了一種新型態的 AI 競爭,其重心不再是模型大小,而是路由、成本、控制和運算效率。
Perplexity 執行長 Aravind Srinivas 告訴 CNBC:「單一模型不再是產品本身。現在的產品是一個整合系統,它能將模型置於一個高效的框架中,並將模型與許多工具配對使用。」
這意味著 AI 產品正演變成能夠決定何時使用哪個模型、以及需要哪些外部工具或公司數據來源的系統。例如,客服任務可能不需要最昂貴的模型,但複雜的程式編碼問題可能就需要。例行的內部工作流程可以運行在較便宜的開源模型上,而更困難的步驟則可以升級到更強大的模型處理。
Srinivas 表示:「答案永遠是:針對任務使用最適合的模型。」
替代模型的出現,正值美國企業緊縮 AI 支出之際,這對過去幾年透過銷售最尖端技術而蓬勃發展的 OpenAI 和 Anthropic 構成了新的挑戰。
Perplexity 本週預覽了一款針對其電腦使用產品的新系統,該系統圍繞著中國 Z.ai 的開源模型 GLM 5.2 構建。其設計理念是讓較便宜的模型處理大部分工作,僅在必要時才調用更強大的模型。
這種方法反映了市場上更廣泛的變化。開源權重模型(open-weight models)正變得越來越強大,企業可以自行下載、微調和運行這些模型。與頂尖 AI 實驗室的專有高階模型相比,它們的運行成本也更低。
Benchmark 的普通合夥人 Peter Fenton 表示,這項轉變可能非常劇烈。
Fenton 告訴 CNBC:「一個或許曾是逆向觀點,但正逐漸成為共識的看法是,我們相信在未來 18 到 24 個月內,甚至可能在今年底前,超過 90% 的生成權杖(tokens)將來自開源權重模型。」
權杖是 AI 模型處理和生成的數據單位。Fenton 說:「當你可以使用足夠好的開源權重模型,而無需支付前沿模型公司提供的溢價時,我認為這些公司從推論服務中獲得的利潤將面臨壓力。」
Fenton 指出,轉向開源模型不僅是為了省錢。在某些情況下,針對特定任務進行微調的較小型模型,其速度和性能甚至可能優於大型通用模型。
這也是 Benchmark 投資 Ollama 的原因之一。Ollama 是一家讓開發者和企業更容易下載、運行和管理開源模型的公司。
Ollama 執行長 Jeff Morgan 表示:「模型來自何處、在哪裡創建和訓練固然重要,但對於我們接觸的這些企業來說,更重要的是它在哪裡運行以及如何運行。」
Morgan 說,Ollama 已被超過 85% 的財富美國 500 強企業採用,其中包括航空、保險和醫療保健等受監管行業的公司。他表示,許多公司會從運行在靠近自身數據的較小型模型開始,然後隨著熟悉度增加,再擴展到更大的開源模型。
開源模型的崛起也為美國帶來了戰略挑戰。許多最具競爭力的開源權重模型來自中國實驗室,包括 Z.ai 和 DeepSeek。這使得開源 AI 不僅是商業議題,也成為政策和國家競爭力的議題。
Srinivas 表示,美國應該支持開源模型,因為它們能讓 AI 更經濟實惠且更容易取得。
Srinivas 說:「如果你希望 AI 的好處能廣泛分佈到美國的小企業和美國盟友國家,那麼 AI 就必須大幅降低成本。而開源是實現這一目標的唯一途徑。」
這項轉變也可能影響科技產業正在進行的大規模資料中心建設。當前的 AI 熱潮假設需求將持續湧向充滿高階晶片的大型雲端資料中心。Srinivas 認為,部分 AI 工作最終可能會轉而在本地運行,例如在消費者或企業擁有的設備上。
這不會消除對資料中心的需求,但可能會催生出更混合式的 AI 系統,其中例行任務在本地運行,而最困難的工作則傳送到雲端中更強大的模型處理。
對於投資者而言,問題在於隨著開源模型變得越來越好,以及企業在選擇模型時變得更加挑剔,最大的 AI 實驗室能否維持其定價權。

