人工智慧標準與創新中心(CAISI)的一份新報告指出,中國的AI模型正逐漸落後於美國的競爭對手。

該機構最近對中國新推出的開源模型 Deepseek V4 Pro 進行了測試。結果顯示,它大約落後美國領先模型八個月。CAISI 測試了其在網路安全、軟體開發、數學、自然科學和抽象推理等方面的表現。

CAISI 稱 Deepseek V4 是迄今為止能力最強的中國 AI 模型。但在內部測試中,據稱其表現不如 Deepseek 自身技術報告所稱。Deepseek 將該模型定位為與當前美國模型如 Opus 4.6 和 GPT-5.4 大致相當。

CAISI 則表示,它實際上更接近較舊的 GPT-5,尤其是在抽象推理、網路安全和軟體開發方面。數學是 Deepseek V4 幾乎能與頂尖美國模型匹敵的唯一領域。

根據 CAISI 的說法,美國和中國模型之間的差距持續擴大,Deepseek V4 Pro 的水準相當於八個月前發布的 GPT-5。| 圖片:CAISI

該中心可能帶有其政治議程,隸屬於美國國家標準暨技術研究院(NIST)。其報告描繪了美國和中國模型之間差距不斷擴大的景象。然而,獨立測量結果卻呈現出不同的情況,顯示兩者差距大致保持不變。

獨立的 Artificial Analysis 智慧指數則呈現出不同的情況,顯示美國和中國之間的差距隨著時間推移大致保持穩定。| 圖片:Artificial Analysis (截圖)

價格可能開始比原始能力更重要

在價格方面,Deepseek V4 具有明顯優勢。在七項測試中,有五項的成本低於可比較的 GPT-5.4 mini。隨著 AI 模型預期將運行更長時間並處理更複雜的任務,價格正成為一個更大的因素。與此同時,頂級的美國模型價格持續上漲。

這很重要,因為目前尚不清楚這些模型實際能提升多少生產力。企業沒有可靠的方法來衡量投資報酬率,特別是當你考慮到訓練、技能提升和錯誤檢查等下游影響時。

超過一定的能力門檻後,低價的「夠用就好」表現可能比高價的頂級表現更具吸引力。據傳將被 SpaceX 收購的 Claude Code 競爭對手 Cursor,其客製化微調的程式碼模型便是基於一個中國開源模型構建,使其成本顯著低於 OpenAI 和 Anthropic 提供的產品。

OpenAI 執行長 Sam Altman 對此似乎意見不一。他在 X 上最近的一篇貼文中寫道:「我一直在想,我希望模型更便宜/更快,勝過希望它們更聰明,但似乎更聰明仍然是最重要的事情。」

Altman 的觀點也可能基於這樣的假設:更聰明的 AI 可以幫助自我改進,從而全面加速進程。OpenAI、Anthropic 和中國開發商最近都表示,他們自己的模型已經在加速其研發工作。