Kimi 正式推出 K3 多模態模型,擁有 2.8 兆參數和一百萬 token 的上下文視窗。根據該公司自己的基準測試,K3 的性能表現與領先的專有模型不相上下。

Kimi 表示,這款全新的旗艦模型 K3 總計有 2.8 兆參數,能夠原生處理圖像和影片,並支援一百萬 token 的上下文視窗。Kimi 稱 K3 是首個達到約 3 兆參數規模的開源模型。完整的模型權重預計將於 7 月 27 日前發布。此模型主要針對長時間的程式設計任務、知識工作和複雜推理應用。

在 Kimi 自己的基準測試中,K3 雖然仍略遜於頂級專有模型 Claude Fable 5 和 GPT 5.6 Sol,但擊敗了所有其他受測系統,包括 Claude Opus 系列模型和中國競爭對手 GLM-5.2。Kimi 表示,所有結果均由該公司提供,並在最高或高思考強度下達成。

Kimi K3 在六項程式設計基準測試中贏得兩項,其餘則名列第二或第三。

在通用代理方面,Kimi K3 在六項測試中贏得三項。Fable 5 則在兩項視覺代理測試中拔得頭籌。

在全部 35 項測試中,K3 約有七次獲得第一名,其餘大部分則位居第二或第三。Fable 5 贏得了最多的單項測試。在幾乎所有基準測試中,K3 都以顯著優勢擊敗了 Opus 4.8、GPT 5.5 和 GLM 5.2。然而,根據不同的基準測試,使用了三種代理系統之一:KimiCode、Claude Code 或 Codex,這意味著結果並非都在完全相同的條件下收集。

獨立測試實驗室 Artificial Analysis 發布了對 Kimi K3 的首次評估。該模型在 Artificial Analysis 智慧指數上獲得 57 分,與 Opus 4.8 和 GPT-5.5 相當,但仍落後於 Fable 5 和 GPT-5.6 Sol。這與 Kimi 自己的說法大致吻合。

Kimi K3 在 Artificial Analysis 智慧指數上獲得 57 分,總體排名第四,落後於 Claude Fable 5 (60 分)、GPT-5.6 Sol (59 分) 和 Claude Opus 4.8 (56 分)。

在代理任務方面,K3 在 GDPval v2 上的 Elo 評分達到 1,668,較 K2.6 的 1,190 分大幅躍升。它擊敗了 GLM-5.2 (1,514 分)、GPT-5.5 (1,494 分) 和 Claude Opus 4.8 (1,600 分),儘管仍不及 Claude Fable 5 (1,760 分)。

K3 還在 AutomationBench-AA(Artificial Analysis 版本的 Zapier 代理 SaaS 工作流程評估)中以 53% 的分數位居榜首。

在 AA-Briefcase(一項私有的長期知識工作評估)中,K3 的總體 Elo 評分達到 1,547,較 K2.6 提升了 732 分。僅 Claude Fable 5 的分數更高。Artificial Analysis 稱 K3 表現全面,其評分標準和分析品質接近 Fable 5 的水準。不過,GPT-5.6 Sol 在呈現品質方面仍領先。

K3 在 AA-Omniscience 指數上的準確度從 33% 提升至 46%,使總體分數從 +6 提高到 +18。然而,其幻覺率卻從 39% 上升到 51%,這意味著即使 K3 答對了更多問題,它也編造了更多答案。

Kimi 表示,該模型的主要應用場景是需要最少人為監督的長期軟體開發。K3 旨在分析大型程式碼庫、協調終端工具,並在多個工作步驟中保持專注於一項任務。

該模型將程式設計與視覺回饋結合:它檢查螢幕截圖、修改程式碼,然後檢查可見的輸出。Kimi 將這種閉環系統稱為「Vision in the Loop」,並將其定位為遊戲開發、UI 設計和 CAD 的基礎。

作為展示,Kimi 秀出了一款據稱由 K3 完全在瀏覽器中,利用 Three.js、WebGPU 和 GPU Compute 打造的程序生成 3D 開放世界遊戲,以及一個互動式黑洞視覺化。在開放世界演示中,K3 程序性地生成了環境,並使用外部工具創建了 3D 騎手和馬匹模型。其他演示還包括長征十號火箭發射與返回的模擬,以及一個 Game Boy Advance 模擬器。

K3 採用了專家混合(mixture-of-experts)架構,一次只啟用 896 個專家中的 16 個。它還搭配了一種名為 Kimi Delta Attention 的新型注意力架構,Kimi 表示這能使百萬 token 上下文的解碼速度提高達 6.3 倍。據報導,「注意力殘差」(Attention residuals)將訓練效率提高了約 25%,同時僅增加了不到 2% 的額外計算開銷。

根據 Kimi API 文件,一百萬個輸入 token 在快取命中時費用為 0.30 美元,未命中時為 3.00 美元。一百萬個輸出 token(包括推理)費用為 15.00 美元。這些價格不論上下文長度如何都適用。快取會自動發生,這使得未修改的長前綴對於代理和大型程式碼庫特別有用。

這使得 K3 的價格遠高於其前身 K2.6,後者官方價格為一百萬 token 快取命中時 0.16 美元,未命中時 0.95 美元,輸出為 4.00 美元。中國供應商也不再以超低價提供其前沿模型。

儘管如此,K3 仍比西方頂級模型便宜許多,更像是中高階產品。例如,Anthropic 的新模型 Sonnet 5,雖然輸入每百萬 token 也要 3 美元,輸出 15 美元,但性能卻較低。

根據 Artificial Analysis 的數據,K3 在智慧指數上平均每項任務花費 0.94 美元,接近 GPT-5.6 Sol 的 1.04 美元,約為 Opus 4.8 的 1.80 美元的一半。不過,它遠高於 GLM-5.2 (0.32 美元) 和 DeepSeek V4 Pro (0.04 美元) 等開源模型。

每項任務 0.94 美元,Kimi K3 的價格與 GPT-5.6 Sol (1.04 美元) 處於相同範圍,但成本約為 Opus 4.8 (1.80 美元) 的一半。DeepSeek V4 Pro (0.04 美元) 和 GLM-5.2 (0.32 美元) 等開源競爭對手則便宜得多。

K3 也比其前身使用了更少的 token。它完成所有九項評估約需要 1.32 億個輸出 token,低於 K2.6 的約 1.66 億個,減少了 21%,同時分數提高了 13 分。然而,由於 token 價格大幅上漲,K3 在大多數情況下每項任務的成本可能仍會高於 K2.6。

K3 目前已可透過 Kimi.com、適用於 iOS、Android 和 HarmonyOS 的行動應用程式、Kimi Work 桌面客戶端(3.1.0 版及更高版本)以及 Kimi Code 取得。在 OpenRouter 上,該模型以「moonshotai/kimi-k3」的識別碼列出,儘管目前僅透過 Moonshot 本身提供服務。模型的開源權重預計將於七月底前發布。

對於企業用戶,Kimi 提供了一個獨立版本,具備成員管理和個人與企業帳戶分離的功能。一個名為 Kimi Hosted Agent 的規劃平台將為長期運行的任務提供隔離的環境和執行時。有興趣的用戶現在可以註冊候補名單。