4月24日,中國AI公司 DeepSeek 發布了其備受期待的旗艦模型 V4 預覽版。該模型採用了新設計,能更有效地處理大量文本,因此可處理比上一代模型更長的提示詞。與 DeepSeek 先前的模型一樣,V4 也是開源的,這意味著任何人都可以下載、使用和修改它。
V4 標誌著 DeepSeek 自2025年1月推出推理模型 R1 以來,最重要的一次發布。R1 在有限的運算資源下進行訓練,以其強勁的性能和效率震驚了全球AI產業,幾乎讓 DeepSeek 從一個鮮為人知的研究團隊,一躍成為中國最知名的AI公司。
它也助長了其他中國AI公司發布開源模型(open-weight model)的浪潮。此後 DeepSeek 一直保持相對低調,但在本月初,它透過在其模型線上版本中添加「專家(expert)」和「閃電(flash)」模式,有效地預告了 V4 的發布,引發外界猜測這些更新與即將到來的大型發布有關。
儘管該公司已成為中國AI雄心的強大象徵,但其重返尖端前沿模型的重大舉動,是在經歷數月的審查之後,包括重要的人員離職、先前模型發布的延遲,以及來自美國和中國政府日益嚴格的審查。那麼,V4 會像 R1 那樣震撼AI領域嗎?幾乎可以肯定不會,但這次發布之所以重要,有三大原因。
一、為開源模型開闢新天地就像之前的 R1 一樣,DeepSeek 聲稱 V4 的性能可與市面上最好的模型媲美,但價格卻只是其一小部分。這對開發者和使用該技術的公司來說是個好消息,因為這意味著他們可以按照自己的條件,存取前沿AI能力,而無需擔心成本飆升。
新模型有兩個版本,都可在 DeepSeek 的網站和應用程式上取得,並向開發者開放 API 存取。V4-Pro 是一個較大的模型,專為編碼和複雜的代理任務而設計;V4-Flash 則是較小的版本,旨在運行更快、成本更低。兩個版本都提供推理模式,模型可以在其中仔細解析使用者的提示詞,並在解決問題時顯示每個步驟。
對於 V4-Pro,DeepSeek 每百萬輸入 token 收費 1.74 美元,每百萬輸出 token 收費 3.48 美元,這僅是 OpenAI 和 Anthropic 同類模型成本的一小部分。V4-Flash 甚至更便宜,每百萬輸入 token 約 0.14 美元,每百萬輸出 token 約 0.28 美元,使其成為市面上最便宜的頂級模型之一。
這將使其成為一個非常有吸引力的應用程式開發模型。在性能方面,V4 毫不意外地比 R1 有了巨大飛躍,它似乎是幾乎所有最新大型AI模型的強大替代品。根據該公司分享的結果,在主要基準測試中,DeepSeek V4-Pro 與領先的閉源模型競爭,其性能與 Anthropic 的 Claude-Opus-4.6、OpenAI 的 GPT-5.4 和 Google 的 Gemini-3.1 相匹配。
與其他開源模型(例如阿里巴巴的 Qwen-3.5 或 Z.ai 的 GLM-5.1)相比,DeepSeek V4 在編碼、數學和 STEM 問題上都超越了它們,使其成為有史以來發布的最強大開源模型之一。DeepSeek 還表示,V4-Pro 在代理編碼任務的基準測試中,現已躋身最強開源模型之列,並在衡量執行多步驟問題能力的其他測試中表現出色。
根據該公司分享的基準測試結果,其寫作能力和世界知識也處於領先地位。在與模型同時發布的技術報告中,DeepSeek 分享了一項對 85 名經驗豐富的開發者進行的內部調查結果:超過 90% 的人將 V4-Pro 列為其編碼任務的首選模型之一。DeepSeek 表示,它已針對流行的代理框架,例如 Claude Code、OpenClaw 和 CodeBuddy,對 V4 進行了專門優化。
二、實現記憶體效率的新方法V4 的關鍵創新之一是其長上下文視窗,模型一次可以處理的文本量。兩個版本都可以處理 100 萬個 token,這足以容納《魔戒》三部曲和《哈比人》的全部內容。該公司表示,這個上下文視窗大小現在是所有 DeepSeek 服務的預設值,並且與 Gemini 和 Claude 等尖端模型版本所提供的能力相匹配。
但重要的是,不僅要知道 DeepSeek 實現了這一飛躍,還要了解它是如何做到的。V4 對該公司以前的模型進行了重大的架構變革,特別是在注意力機制方面,這是AI模型幫助它們理解提示詞各部分之間關係的特徵。隨著提示詞文本變長,這些比較變得更加昂貴,使得注意力機制成為長上下文模型的主要瓶頸之一。
DeepSeek 的創新在於讓模型對其關注的內容更具選擇性。V4 不再將所有早期文本視為同等重要,而是壓縮舊資訊並專注於當前時刻最可能重要的部分,同時仍完整保留附近的文本,以免遺漏重要細節。DeepSeek 表示,這大幅降低了使用長上下文的成本。
在 100 萬 token 的上下文中,V4-Pro 僅使用其先前模型 V3.2 所需運算能力的 27%,同時將記憶體使用量削減至 10%。V4-Flash 的削減幅度更大,僅使用 10% 的運算能力和 7% 的記憶體。實際上,這可以降低開發需要處理大量資料的工具成本,例如可以閱讀整個程式碼庫的AI編碼助理,或可以分析大量文件檔案而不會不斷遺忘先前內容的研究代理。
DeepSeek 對長上下文視窗的興趣並非始於 V4。在過去一年半中,該公司悄悄發表了一系列關於AI模型如何「記憶」資訊的論文,實驗壓縮和數學技術,以擴展AI模型實際可處理的範圍。三、邁向擺脫 Nvidia 依賴的艱難第一步V4 是 DeepSeek 首個針對中國國產晶片(例如華為的 Ascend)進行優化的模型,此舉已使這次發布成為一項考驗,檢視中國本土AI產業是否能開始擺脫對美國晶片巨頭 Nvidia 的依賴。
這在很大程度上是預料之中的,因為《The Information》本月初報導稱,DeepSeek 並未讓 Nvidia 和 AMD 等美國晶片製造商提前存取 V4,儘管預發布存取是常見做法,旨在讓晶片製造商在發布前優化對新模型的支援。相反地,據報導該公司僅向中國晶片製造商提供了早期存取權限。
週五,華為表示其基於 Ascend 950 系列的 Ascend 超級節點產品將支援 DeepSeek V4。這意味著希望運行自己修改版 DeepSeek V4 的公司和個人,將能夠輕鬆使用華為晶片。路透社先前報導,中國政府官員建議 DeepSeek 在其訓練過程中整合華為晶片。
這種壓力符合中國產業政策的更廣泛模式:戰略性產業通常會被推動,有時甚至被實際要求,以符合國家自給自足的目標。但在AI領域,這種緊迫性尤為突出。自 2022 年以來,美國的出口管制已切斷中國公司獲取 Nvidia 最強大晶片的途徑,後來也限制了對降級版中國市場晶片的存取。
北京的回應是加速推動國內AI堆疊的發展,從晶片到軟體框架再到資料中心。據報導,中國當局一直在推動資料中心和公共運算專案使用更多國產晶片,包括透過報導中提到的禁止使用外國製造晶片、採購配額,以及要求將 Nvidia 晶片與華為和寒武紀等中國公司的替代品搭配使用。
然而,取代 Nvidia 並不像更換晶片那麼簡單。Nvidia 的優勢不僅在於其晶片,還在於開發者多年來圍繞其晶片建立的軟體生態系統。轉向華為的 Ascend 晶片意味著需要調整模型程式碼、重建工具,並證明圍繞這些晶片建立的系統足夠穩定,可以嚴肅使用。
值得澄清的是,DeepSeek 似乎尚未完全擺脫對 Nvidia 的依賴。該公司的技術報告顯示,它正在使用中國晶片來運行模型的「推論(inference)」階段,即當有人要求模型完成任務時。但清華大學電腦科學教授劉知遠告訴《MIT Technology Review》,DeepSeek 似乎只將 V4 訓練過程的一部分,適應了中國晶片。
報告沒有說明某些關鍵的長上下文功能是否已適應國產晶片,因此劉知遠表示 V4 可能仍主要在 Nvidia 晶片上進行訓練。多位因政治敏感性而要求匿名的消息人士告訴《MIT Technology Review》,中國晶片在性能上仍不如 Nvidia 晶片,但更適合推論而非訓練。
DeepSeek 也將 V4 的未來成本與這次硬體轉變掛鉤。該公司表示,在華為的 Ascend 950 超級節點於今年下半年開始大規模出貨後,V4-Pro 的價格可能會大幅下降。如果成功,V4 可能會是中國正在成功建立平行AI基礎設施的早期跡象。



