Mellum2 是一個 120 億參數的專家混合模型 (Mixture-of-Experts model),從頭開始以自然語言和程式碼進行訓練。該模型每處理一個 token 僅啟用 25 億參數,使其在實現高吞吐量、低延遲推論方面表現高效。

Mellum2 可用於路由、RAG、摘要、子代理、高吞吐量程式碼功能以及私有部署。它以 Apache 2.0 授權發布。與同等規模的模型相比,Mellum2 在基準測試中展現出具競爭力的效能,同時推論速度快兩倍以上。立即在 Hugging Face 下載模型:https://huggingface.co/collections/JetBrains/mellum-2欲了解架構細節、訓練設定、基準測試和評估方法,請閱讀完整的技術報告:https://arxiv.org/pdf/2605.31268今天我們發布 Mellum2,這是一個開源的專家混合模型,專為低延遲的文字與程式碼工作負載進行優化。

Mellum 最初是一個程式碼補齊模型。透過 Mellum2,我們將其基礎擴展到更廣泛的自然語言和軟體工程任務,同時保持模型專注於高效推論和可部署性。現代 AI 系統越來越依賴多個模型呼叫:路由、檢索、摘要、規劃、驗證和工具使用。其中許多操作對延遲敏感,並且不需要最大的可用模型。

Mellum2 正是針對這些工作負載而設計。基準測試亮點在我們的技術報告中,我們評估了 Mellum2 在程式碼生成、推理、科學和數學基準測試中的表現。Mellum2 與同等規模的開源模型相比具有競爭力,同時推論速度快兩倍以上,使其適用於高吞吐量的生產工作負載。

模型架構Mellum2 是一個專家混合模型。其規格如下:模型名稱 Mellum2,總參數 120 億 (12B),每 token 啟用參數 25 億 (2.5B),模態為文字和程式碼,授權為 Apache 2.0。專家混合 (MoE) 架構在保持模型總容量高的同時,僅針對每個 token 啟用部分參數。

這使得推論更有效率,並有助於降低即時工作負載的服務成本。Mellum2 有意專注於文字和程式碼,而非多模態任務。這種專業化使模型保持精簡高效,適用於軟體工程工作負載。主要應用場景路由與編排Mellum2 作為多模型系統中輕量級的路由和編排模型表現良好,包括提示詞分類、工具選擇和中間控制流程步驟。

RAG 管線該模型非常適合延遲敏感的檢索管線,包括上下文壓縮、摘要和檢索後處理。子代理Mellum2 可用於代理子任務,例如規劃、驗證、轉換和上下文準備,減少了為中間操作呼叫大型模型的需求。私有部署由於 Mellum2 是開源且服務效率高,因此可以部署在涉及專有程式碼或內部資料的自託管環境中。

為何範圍明確的模型很重要隨著 AI 系統的成熟,最有效的架構正變得越來越不單體化。單一的尖端模型可能很強大,但生產系統通常需要多個專用元件協同工作:檢索器、路由器、程式碼感知模型、驗證器、工具呼叫器和大型推理模型。我們將 Mellum2 視為一個「焦點」模型:一個快速、範圍明確的模型,專為大型 AI 系統中的高頻率任務進行優化。

目標不是取代堆疊中的每個模型,而是讓堆疊更快、更便宜、更容易控制。開始使用 Mellum2如果您正在為軟體工程構建 AI 系統,無論是在整合開發環境 (IDE) 中、RAG 管線中、作為代理工作流程的一部分,還是在私有基礎設施上,Mellum2 都已準備好供您嘗試。