Together AI 的 AI 工程師 Zain Hasan 學習如何使用 AI 程式碼助理,同時也留意成本效益。他會將複雜的問題交給頂尖模型處理,例如 Anthropic 的 Fable,這類模型在推理和能力上都接近當前最先進水準。
然而,如果 Hasan 外包的任務較為簡單,他就會轉而使用能力較弱但成本較低的語言模型。目前對他而言,較便宜的模型通常是 GLM 5.2。這款模型由北京實驗室 Z.ai 於 6 月 16 日發布,屬於開源權重模型,意味著任何具備足夠硬體的組織都可以免費下載並自行部署。
即使是付費使用 Z.ai 的 GLM 服務,也能節省開支,因為該公司的 API 費用為每百萬輸出 token 4.40 美元。這比使用 Anthropic 的 Opus 4.8 模型便宜五倍以上,更是 Anthropic Fable 程式碼模型價格的十分之一。輸出 token 是模型回應提示詞時生成文字的基本單位。
然而,Hasan 指出,全球許多軟體工程師尚未完全意識到特定程式碼專案的 AI 總成本。Hasan 表示:「許多公司目前仍在摸索這項技術,因此實際上並沒有明確的 token 預算。」
當有其他人支付費用時,許多軟體工程師的理性做法是完全不計算成本。他們認為:「最簡單的方式就是選擇最強大的模型。」這種不計成本的習慣,加上當今軟體公司寬鬆的 token 預算,可能成為保護美國頂尖 AI 實驗室最寬廣的護城河。
Z.ai 的 GLM 5.2 是一個擁有 7530 億參數的 AI 大型語言模型 (LLM),儘管它一次只啟用 400 億參數。這項優化技術能提升模型的回應速度。Z.ai 以 MIT 開源授權發布此模型,這意味著任何人都可以自由分發、複製、修改和使用它。
GLM 5.2 的發布加劇了人們對美國 AI 公司可能失去競爭優勢的擔憂。該模型在 FrontierSWE 和 PostTrainBench 等一些代理式程式碼基準測試中,得分幾乎與 Opus 4.8 持平。網路安全研究人員也發現 GLM 5.2 在網路安全基準測試中表現出色,這項能力促使人們將其與 Anthropic 的 Mythos 進行比較。
Z.ai 的出現也符合更廣泛的趨勢。根據史丹佛大學的 AI 指數報告,中國公司在 2025 年生產的「值得關注」AI 模型數量,已達到美國同行的一半以上,相較於 2023 年的三分之一和 2020 年的五分之一,顯著成長。
GLM 5.2 卓越的基準測試分數,為開源權重模型和中國開發的模型都創下了新紀錄,這讓一些美國觀察家感到不安。該模型的中國背景也讓美國及其他國家中,不願將敏感資料經由中國相關基礎設施傳輸的公司,在使用上變得複雜。
然而,該模型的開源權重提供了一個解決方案。任何擔心資料傳輸地點的組織,都可以選擇在自己的硬體上部署模型。這與大多數頂尖模型形成對比,後者通常僅透過 API 存取,不提供自行部署的選項。
Z.ai 在 GLM 5.2 發布當天,也同步發表了一份研究報告,以自家數據支持其模型。該報告並未提及 Anthropic 的 Mythos 或 Fable,因為這些模型在報告發布時僅宣布但尚未公開可用。
報告主要聚焦於 Anthropic 的 Opus 4.8 和 OpenAI 的 GPT-5.5。儘管 GLM 5.2 在基準測試中表現常與 Opus 4.8 不相上下,但報告僅聲稱在兩個較不困難的推理基準測試中獲勝,而在程式碼生成方面則無任何勝績。
報告中的許多基準測試顯示,GLM 5.2 在代理式程式碼生成方面落後於 Opus 4.8 (有時也落後於 OpenAI 的 GPT-5.5)。例如,在困難的長期代理式程式碼基準測試 SWE-Marathon 中,GLM 5.2 僅完成了 13% 的任務。
Claude Opus 4.8 在此基準測試中的得分是 GLM 5.2 的兩倍。Opus 4.8 也在 NL2Repo、DeepSWE 和 Tool-Decathlon 等程式碼基準測試中,取得了 10% 或更高的領先優勢。
程式設計師如何使用 GLM 5.2?將 GLM 5.2 應用於自身工作流程的軟體工程師們,回報了各種不同的結果。Hasan 表示:「我發現 GLM 5.2 的主要優點是它能處理更多長期任務。」他的公司在北美基礎設施上部署了 GLM 5.2。
他提到,早期的開源權重模型在約 5 到 15 次來回互動後,通常就會失去連貫性,但「這個模型我注意到可以使用好幾個小時,它仍然能保持清晰的思緒。」
丹佛 MetaRouter 的首席軟體工程師 David Nix,將大型語言模型應用於日常工作和個人專案中(Nix 也經營一個 AI 工程師的職位公告板)。Nix 表示,GLM 5.2「非常接近」Anthropic 的 Opus 和 OpenAI 的 GPT-5.5 等頂尖模型,足以讓它在他的工作流程中佔有一席之地。
Nix 說:「例如,它在前端開發方面表現相當出色,我不需要總是為了這些任務而使用 Opus 或 Fable。」他估計 GLM 5.2 處理了他每天交給 LLM 的 10% 到 20% 的工作,並且現在是他處理某些特定任務(如前端設計)的首選。
其他人也回報了同樣的優勢。Hasan 稱 GLM 5.2 在網頁設計方面「品味極佳」。波蘭克拉科夫 Screen Studio 的軟體工程師 Kacper Michalik 在使用 GLM 5.2 建立網站表單時也獲得了不錯的結果。
另一方面,印度班加羅爾 Indhic AI 的軟體工程師 Sai Kiran Myadaram 對 Z.ai 的評價則不那麼正面。他在 GLM 5.2 發布當週就訂閱了 Z.ai 的服務,卻發現模型很快就耗盡了 token 配額。
他表示:「Z.ai 提供的每週配額,我不到兩三天就用完了。」Michalik 也直接使用 Z.ai,他對模型的品質沒有太大問題,但偶爾會遇到速率限制,儘管他使用的是免費方案。
除了速率限制,Myadaram 在要求模型處理前端小修復時,還遇到了模型幻覺和過度規劃的問題。Myadaram 說:「它把我的程式碼庫搞得一團糟。」此後,他已轉回使用 OpenAI 的 Codex。



