Snowflake 在一項實際基準測試中比較了 GLM-5.2 和 Opus 4.7。這款中國模型展現了不俗的實力。
這項測試涵蓋了 103 項任務,每項任務都執行三次,要求模型編寫能在 DuckDB 和 Snowflake 上運行的程式碼。當每個模型每項任務有三次嘗試機會時,兩者的表現幾乎不分軒輊,分別解決了 66% 和 67% 的任務。
然而,首次嘗試的準確性有所差異:Opus 達到了 53.7%,而 GLM 僅為 47.6%,這表明 GLM 的輸出一致性較差。此外,這款中國模型平均每項任務運行 99 次,而 Opus 則為 80 次,並消耗了 8.6 億個 token,幾乎是 Opus 4.39 億個 token 的兩倍。
儘管 Opus 4.7 是一款更優秀的模型,但 GLM 在 Snowflake 的程式碼基準測試中仍具競爭力,且成本遠低於前者。根據 Snowflake 執行長 Sridhar Ramaswamy 的說法,GLM 的優勢在於能夠同時在 DuckDB 和 Snowflake 這兩個平台上可靠地驗證程式碼,這也是為何只有 GLM 能夠解決某些特定任務的原因。
GLM 的弱點在於過早放棄,以及過度執著於檢查錯誤的項目。在某項任務中,GLM 在 24 分鐘內發出了 411 次工具呼叫,檢查了行數、分佈、空值和欄位類型,但三次嘗試均告失敗。相較之下,Opus 在 9 分鐘內僅用 49 次呼叫就解決了相同的任務。
Ramaswamy 指出,GLM 能夠產生更簡潔程式碼的說法並未得到證實。更多的檢查並不一定會帶來更正確的結果。儘管如此,Snowflake 團隊對 GLM-5.2 仍感到興奮,並希望將其提供給客戶使用。
這些結果在價格背景下顯得尤為重要。根據智譜(Zhipu)的官方價格表,GLM-5.2 的定價為每百萬輸入 token 1.40 美元,每百萬輸出 token 4.40 美元。一些第三方供應商甚至能提供更低的價格。相較之下,Claude Opus 4.7 的輸入價格為 5 美元,輸出價格為 25 美元;而 GPT-5.5 的輸入價格為 5 美元,輸出價格為 30 美元。
儘管 GLM 較高的 token 使用量會稍微抵消一部分價格優勢,但 Anthropic 和 OpenAI 正面臨嚴峻的定價壓力,尤其是在程式碼生成這個西方 AI 實驗室都寄予厚望的旗艦應用案例上。
如果這種定價壓力導致營收增長放緩,甚至更糟地出現萎縮,那麼已經過度膨脹的 AI 市場將面臨真正的壓力測試。OpenAI 和 Anthropic 的估值建立在營收持續快速增長的假設之上,而這些估值又與數十億美元的 AI 基礎設施建設投資(從資料中心到晶片訂單)緊密相連。

