中國AI公司MiniMax發布了其全新模型M3。該模型號稱是首個結合頂級程式碼效能、百萬級提示詞上下文視窗以及原生多模態能力的開源模型。

MiniMax表示,這種結合此前對開源模型而言是遙不可及的,僅限於Opus 4.7、GPT-5.5或Gemini 3.1 Pro等專有系統。一種全新的注意力機制使得這項突破成為可能,它在將上下文視窗擴展至百萬級提示詞的同時,有效控制了運算成本。在內部測試中,M3還能自主規劃、偵錯並自我修正,持續數小時。

基準測試顯示M3效能媲美專有模型

根據MiniMax的數據,在知名的軟體開發基準測試SWE-Bench Pro上,M3取得了59%的得分。這使其超越了GPT-5.5和Gemini 3.1 Pro,僅略遜於Opus 4.7。M3在終端任務和工具使用方面也達到了專有模型的等級。

在自主網路搜尋方面,它在BrowseComp上以83.5分超越了Opus 4.7(79.3分)。不過,Anthropic此後已發布了效能稍強的Opus 4.8模型。

MiniMax在自家基準測試中將M3定位為接近Opus 4.7,並在部分項目上領先GPT-5.5和Gemini 3.1 Pro。

為了更貼近真實的開發者工作流程,MiniMax建構了一個模擬器框架,模仿典型的行為模式。這些模式包括精煉需求、討論解決方案、回應中間結果,以及跨多個上下文執行任務。這使得模型在訓練過程中能接觸到多輪協作,而不僅僅是單一、明確定義的提示詞。

三項測試展現長期自主性

MiniMax描述了三項內部實驗,旨在展示這些能力如何協同運作。在第一項實驗中,團隊讓M3獨立重現一篇關於大型語言模型(LLM)微調的論文。該模型在近十二小時內無需人工干預,產生了18個提交(commits)和23張圖表,並證實了論文的關鍵發現。

M3在十二小時內獨立重現了一篇ICLR 2025論文,得分為0.650。

在第二項測試中,M3被要求優化Nvidia Hopper GPU上用於矩陣乘法的運算核心(compute kernel),這是大型模型推論中最耗費運算資源的建構區塊之一。MiniMax表示,經驗豐富的團隊通常需要一到兩週才能完成這項任務。M3僅獲得任務描述、基準測試腳本和一個非功能性的程式碼骨架,沒有可供複製的參考解決方案。

大約24小時後,該模型將Hopper硬體利用率從7.6%提升至71.3%。大多數其他受測模型在數十次嘗試後便放棄,而M3則克服了數個瓶頸,直到第145次嘗試才達到最佳解決方案。

在優化FP8核心時,M3在147次運行後達到Hopper峰值效能的71.3%,超越了Opus 4.7。不過,Anthropic的模型所需的運行次數遠少於M3。

在第三項測試PostTrainBench中,M3的任務是獨立訓練四個基礎模型,包括資料合成、訓練、評估和迭代,全程無需人工輸入。該模型表現僅次於Opus 4.7和GPT-5.5,但遠優於其餘受測模型。

MiniMax表示,M3從一開始就採用混合模態進行訓練。所謂的「交錯資料」(interleaved data),即文字和圖像在序列中交織在一起,其重要性超出了最初的預期。在重新設計資料管線後,訓練規模可達100兆個提示詞。

新型注意力機制實現百萬級上下文視窗的經濟性

其技術基礎是一種名為MiniMax稀疏注意力(MiniMax Sparse Attention, MSA)的新型注意力變體。傳統的完全注意力機制會將每個提示詞與所有其他提示詞進行比較,因此運算成本隨輸入長度呈平方級增長。MSA透過僅針對選定區段而非每個提示詞對計算注意力分數來避免此問題。

儲存的上下文,即所謂的鍵值快取(key-value cache, KV cache),被分割成區塊。一個初步的篩選步驟會決定哪些區塊與當前查詢實際相關。只有這些相關區塊才會進入完整的計算。

MSA預先篩選相關的KV區塊並僅處理這些區塊,賦予M3百萬級提示詞上下文視窗。

在GPU運算層面也有所改變。通常,模型會為每個獨立查詢從記憶體中載入匹配的KV區塊,許多區塊會被多次提取。MSA則顛倒了邏輯,依序處理區塊。對於每個區塊,所有需要它的查詢都會被批次處理。每個區塊只需從記憶體中讀取一次,採用連續存取模式而非分散跳躍。MiniMax表示,其實現比競爭的開源替代方案運行速度快四倍以上。

總而言之,M3在百萬級提示詞上下文下,每個提示詞所需的運算量僅為其前代模型的二十分之一。輸入提示詞的處理速度提升九倍以上,回應生成速度則提升十五倍以上。

定價與可用性

M3可透過MiniMax API使用。輸入提示詞數量達512,000個的請求將按標準費率計費;更長的上下文則費用更高。每個請求都可以開啟或關閉「思考模式」(thinking mode)。提示詞方案起價為每月20美元,約可使用17億個提示詞,最高可達120美元,約可使用98億個提示詞。MiniMax表示,模型權重和技術報告將在未來十天內於Hugging Face和GitHub上發布。

MiniMax也更新了其內部代理應用程式MiniMax Code,該應用程式也將開源。

大約三個月前,MiniMax發布了M2.7模型。該公司表示,M2.7積極參與了自身的開發,運行了超過100輪的自主優化循環,並處理了MiniMax內部強化學習(RL)團隊30%至50%的工作流程。