DeepSeek 備受期待的模型回歸,但其基準測試表現已非業界領先。
經過數月的延遲與諸多猜測,DeepSeek 終於發布了備受期待的 DSV4 模型。這是繼 DSV3(2024 年 12 月)和 DSR1(2025 年 1 月)之後,該系列的首個主要版本模型。它使 DeepSeek 系列與目前的開源模型領導者 Kimi K2.6,以及兩天前發布但較不為人知的 Xiaomi Mimo 2.5 保持一致。
DSV4 系列模型大致與 Gemini 3.1、GPT 5.4、Opus 4.6 等級相當,採用高達 1.6 兆參數的 MoE 架構,並以 FP4 格式在 32 兆個 token 上進行訓練。其支援 100 萬個 token 的上下文長度,這得益於其全新的壓縮稀疏注意力(Compressed Sparse Attention, CSA)和高度壓縮注意力(Heavily Compressed Attention, HCA)技術。
此外,DeepSeek 罕見地同時發布了基礎(Base)和指令(Instruct)版本,這無疑為未來可能推出的「DeepSeek R2」奠定了基礎,儘管此版本已具備推理能力。
這份技術報告長達 58 頁,內容詳盡,展示了他們在今年一月發布的 Manifold Constrained Hyper-Connections (mHC) 論文中提出的訓練與推論見解和改進。報告中也提及持續使用 Moonshot 的 Muon 技術,以及 CSA/HCA 在 DeepSeek 3.2-Exp 已令人印象深刻的稀疏注意力基礎上,實現了整體「驚人」的效率提升。
在 100 萬個 token 的情況下,與 DeepSeek-V3.2 相比,僅需 27% 的浮點運算(FLOPs)和 10% 的 KV 快取記憶體。
華為 CANN 相容性背後的地理政治背景,是 DeepSeek 正在擺脫對受出口管制 NVIDIA/CUDA 晶片的依賴。儘管昇騰晶片的供應量仍僅為 H100 的四分之一,但這對中國實現完全自主性而言,是一個重要的里程碑。
AI 推特回顧
頭條新聞:DeepSeek V4
DeepSeek 發布了 DeepSeek-V4 Pro 和 DeepSeek-V4 Flash,這是自 V3 以來首次重大的架構更新,也是首次明確的兩層級產品線。它們具備 100 萬個 token 的上下文長度、混合推理/非推理模式、MIT 授權,以及一份被多位研究人員譽為年度最重要或撰寫最佳的模型論文之一的技術報告。
綜合各方反應,普遍共識是 V4 在開源長上下文和代理式程式碼生成性能方面取得了實質性進展,但整體仍略遜於頂級的閉源前沿模型。獨立基準測試人員將 V4 Pro 定位在開源模型中的第二梯隊,大致與 Kimi K2.6 / GLM-5.1 / 強大的 Claude Sonnet 級別到 Opus 級別相當,具體取決於基準測試和模式,尤其在長上下文和代理式性能方面表現出色;然而,對於它與 GPT-5.x / Opus 4.7 的接近程度,以及這項進展是「民主化」還是其架構過於複雜以致於少數開源實驗室難以複製,各方意見分歧。
主要資訊來源包括來自 @ArtificialAnlys 等人的深入評論,以及來自 @vllm_project 等基礎設施/供應商的貼文。
核心事實與技術細節
兩種模型
V4 Pro:總參數 1.6 兆 / 活躍參數 490 億
V4 Flash:總參數 2840 億 / 活躍參數 130 億
由 @ArtificialAnlys、@teortaxesTex、@baseten、@NVIDIAAI 報導。
上下文
100 萬個 token,根據 @ArtificialAnlys 的說法,從 V3.2 的 12.8 萬個 token 大幅提升。
多位發文者將此視為主要成就:「穩固的超長上下文」@teortaxesTex。
訓練規模
反覆提及 32 兆至 33 兆個 token。
@nrehiew_ 指出,在 1.6 兆參數上訓練了 32 兆個 token,即大約每個參數 20 個 token。
@teortaxesTex 引用了 33 兆。
@nrehiew_ 估計預訓練計算量約為 1e25 FLOPs。
推理 / 模式
根據 @Togethercompute 的說法,DeepSeek 提供了三種推理模式。
@ArtificialAnlys 指出其混合「思考/非思考」的定位。
長上下文架構
多個討論串總結了一種新的混合注意力系統:共享 KV 向量、壓縮 KV 流、對壓縮 token 進行稀疏注意力,以及用於近端上下文的局部/滑動窗口注意力。
@ZhihuFrontier 提供了最簡潔的公開總結:透過共享鍵值向量實現 2 倍 KV 減少,c4a 約 4 倍壓縮,c128a 約 128 倍壓縮,對壓縮 token 進行 top-k 稀疏注意力,128 個 token 的滑動窗口,100 萬上下文的 KV 快取為 9.62 GiB/序列 (bf16),比 DeepSeek V3.2 的 83.9 GiB 小 8.7 倍,FP4 索引快取 + FP8 注意力快取又提供了約 2 倍的減少。
@ben_burtenshaw 將其精簡為「KV 快取小 10 倍」。
@TheZachMueller 描述了 CSA + HCA 層模式,採用交替層,V4 Flash 在某些地方使用滑動窗口層而非 HCA。
量化 / 檢查點格式
@LambdaAPI:檢查點採用 FP4 + FP8 混合格式,MoE 專家權重為 FP4,注意力/正規化/路由器為 FP8;聲稱:完整模型可部署在單一 8×B200 節點上。
推論硬體 / 服務
@NVIDIAAI:在 Blackwell Ultra 上,V4 Pro 能為代理式工作流程提供 150+ TPS/使用者互動性。
@NVIDIAAI:發布了使用 vLLM 的 V4 Pro 零日性能帕累托圖。
@SemiAnalysis_:對 H200、MI355、B200、B300、GB200/300 進行了零日支援和基準測試。
@Prince_Canuma:DeepSeek4-Flash 可在 256GB Mac 上運行。
@Prince_Canuma:MLX 量化版本已發布。
@simonw 詢問較小記憶體 Mac 的可行性,暗示社群對此有興趣但支援尚不完整。
@QuixiAI 提醒使用者,許多本地堆疊仍缺乏張量並行(tensor parallel),這很重要,因為 V4 級模型對推論基礎設施的壓力很大。
授權 / 可用性 / 定價
根據 @ArtificialAnlys 的說法,採用 MIT 授權。
透過 @Togethercompute、@baseten、@NousResearch、@Teknium 提供第一方 API 及快速的第三方可用性。
V4 Pro 定價:每 100 萬輸入/輸出 token 分別為 1.74 美元 / 3.48 美元。
V4 Flash 定價:0.14 美元 / 0.28 美元。
也提供快取命中定價。



