返回文章列表  _深入探討 Granite 4.1 大型語言模型背後的資料工程、預訓練、監督式微調及強化學習技術。
_ 作者: Granite 團隊,IBM * * * 簡而言之,Granite 4.1 是一系列密集型、僅解碼器架構的 LLM(3B、8B 和 30B),使用多階段預訓練管線,在約 15 兆個 token 上進行訓練,並支援高達 512K token 的長上下文擴展。
這些模型透過約 410 萬個高品質精選樣本進行監督式微調,並透過基於策略的 GRPO 搭配 DAPO 損失函數(Yu 等人,2025)進行強化學習,進一步精煉。值得注意的是,8B 指令模型儘管採用參數較少的密集型架構,卻能媲美或超越先前的 Granite 4.0-H-Small(32B-A9B MoE)模型。
所有 Granite 4.1 模型均以 Apache 2.0 授權發布。 連結: * Granite 4.1 HF Collection * GitHub Repository * Granite Docs * * * ## 概述 建構高品質的小型語言模型不僅僅是擴展運算資源,更需要貫穿整個訓練過程的嚴謹資料策展。
對於 Granite 4.1,我們優先考慮資料品質而非數量,透過五個預訓練階段逐步精煉資料組合。我們進一步使用「以 LLM 作為評審」的框架來策展監督式微調資料,並應用多階段強化學習管線,系統性地強化模型在數學、程式碼、指令遵循和一般對話方面的性能。
* * * ## 模型架構 Granite 4.1 模型採用僅解碼器的密集型 Transformer 架構。核心設計選擇包括分組查詢注意力 (GQA)、旋轉位置嵌入 (RoPE)、SwiGLU 激活函數、RMSNorm 正規化以及共享輸入/輸出嵌入。
| 元件 | 3B 密集型 | 8B 密集型 | 30B 密集型 | | --- | --- | --- | --- | | 嵌入大小 | 2560 | 4096 | 4096 | | 層數 | 40 | 40 | 64 | | 注意力頭大小 | 64 | 128 | 128 | | 注意力頭數量 | 40 | 32 | 32 | | KV 頭數量 | 8 | 8 | 8 | | MLP 隱藏層大小 | 8192 | 12800 | 32768 | | MLP 激活函數 | SwiGLU | SwiGLU | SwiGLU | | 位置嵌入 | RoPE | RoPE | RoPE | 所有三種模型規模共享相同的訓練管線和資料策略,僅在架構維度上有所不同。
* * * ## 預訓練 Granite 4.1 從頭開始訓練,使用五階段訓練策略,處理約 15 兆個 token。第一至二階段著重於基礎預訓練,第三至四階段進行中期訓練,逐步採用更高品質的資料退火,第五階段則引入長上下文訓練,將上下文視窗擴展至 512K token。
每個階段都採用獨特的資料組合和學習率排程,從廣泛的網路規模資料逐漸轉向更精選、領域特定的內容。  _圖 2: 五階段預訓練管線。
第一至二階段為預訓練,第三至四階段為中期訓練(高品質資料退火),第五階段為長上下文訓練 (LCE)。_ ### 第一階段:通用預訓練(10 兆個 token) 第一階段使用通用的訓練資料組合,搭配冪次學習率排程和暖身,建立廣泛的語言理解能力。
資料組成: * CommonCrawl 約 59%,一般網路資料 * Code 約 20%,程式語言和儲存庫 * Math 約 7%,數學推理資料 * Technical 約 10.5%,科學論文、技術文件和手冊 * Multilingual 約 2%,非英語語言資料 * Domain Specific 約 1.5%,領域特定內容 ### 第二階段:數學/程式碼預訓練(2 兆個 token) 第二階段大幅增加程式碼和數學資料的比例,轉向更強的推理能力,同時仍保持通用語言覆蓋。
資料組成: * Math 約 35%,比第一階段增加 5 倍 * Code 約 30%,增加 1.5 倍 * CommonCrawl-HQ 約 12%,高品質 CommonCrawl 子集 * Synthetic 約 9%,合成高品質資料 * Technical 約 10% * Multilingual 約 3% * Domain 約 1% ### 第三階段:高品質資料退火(2 兆個 token) 第三階段進入中期訓練,採用更平衡、高品質的資料組合和指數衰減學習率排程。
在此階段,我們開始融入思維鏈和合成指令資料。 資料組成: * CommonCrawl-HQ 約 16.67% * Math 約 16.67% * Code 約 16.67% * Synthetic 約 8.5% * Technical 約 12.5% * Multilingual 約 4.5% * Long Chain-of-Thought 約 12.5%,推理軌跡 * Language Instructions 約 7.5%,指令微調資料 * Code Instructions 約 4.5%,指令微調資料 ### 第四階段:高品質資料退火,精煉(0.5 兆個 token) 第四階段繼續中期訓練,採用線性學習率衰減至零,使模型專注於最高品質的可用資料。
資料組成: * CommonCrawl-HQ 約 40% * Code 約 20% * Math 約 20% * Long Chain-of-Thought 約 6% * Code Instructions 約 5% * Language Instructions 約 9%  _圖 3: 預訓練階段中資料組合的演變。
請注意從以網路資料為主(第一階段)到以高品質、指令和推理資料為主(第三至四階段)的逐步轉變。_ ### 第五階段:長上下文訓練 (LCE) 第五個也是最後一個階段,同樣是中期訓練的一部分,透過分階段的長上下文擴展流程,將上下文視窗從 4K 擴展到 512K: 1. 32K 擴展,使用與第四階段相同的資料組合 2. 128K 擴展,使用與第四階段相同的資料組合 3. 512K 擴展,80% 書籍 + 20% 程式碼儲存庫資料(僅限 8B 和 30B 模型) LCE 階段使用從 1e-4 開始並衰減至 0 的指數學習率排程。
為確保模型能原生處理長序列而不會降低短上下文性能,我們在每個 LCE 階段後進行模型合併。基礎模型的 RULER 基準測試結果: | 模型名稱 | 32K | 64K | 128K | | --- | --- | --- | --- | | granite-4.1-3b-base | 75.0 | 66.6 | 58.0 | | granite-4.1-8b-base | 83.6 | 79.1 | 73.0 | | granite-4.1-30b-base | 85.2 | 84.6 | 76.7 | * * * ## SFT:資料準備與品質控制 監督式微調 (SFT) 是將基礎模型轉變為可靠的指令遵循助理的關鍵,因此資料品質至關重要,因為即使少量不正確或產生幻覺的樣本也可能導致不良行為。
為解決此問題,我們採用嚴謹的「以 LLM 作為評審」框架,並結合基於規則的篩選,以策展高品質樣本。這條管線會自動根據結構、語義和行為標準評估每個樣本,在可能的情況下修正問題,並篩除不符合我們品質標準的樣本。  _圖 4: SFT 資料品質管線。
原始對話資料經過「以 LLM 作為評審」的框架,該框架具有多維度評分標準,產生接受/臨界/拒絕的判斷。硬性拒絕的缺陷(幻覺、錯誤前提、不正確計算)無論分數如何都會觸發自動拒絕。_ 我們嚴謹的「以 LLM 作為評審」框架僅評估助理的回應,將系統提示詞、使用者輸入、檢索到的文件和工具輸出嚴格視為上下文資訊。
這確保評審評估的是模型所說的內容,而非它被要求做什麼。在 RAG 設定中,未基於檢索上下文的回應會被標記為幻覺,而工具使用輸出則會根據允許的工具集及其參數結構進行驗證。 我們採用針對不同 SFT 資料類型量身定制的專門評審提示詞,包括多輪對話、RAG 增強回應、工具呼叫互動和多語言對話。
每個回應都會根據六個加權維度進行評分,指令遵循、正確性、完整性、簡潔性、自然度及校準(可選的批判性思維檢查)。樣本根據確定性分數閾值被接受、標記為臨界或拒絕,對於幻覺、錯誤前提或不正確計算等嚴重缺陷,硬性拒絕規則會覆蓋分數。 為了補充語義評估,我們應用了確定性基於規則的管線,透過文字正規化、截斷與長度篩選、結構驗證和洩漏檢測來強制執行結構完整性。
最後的全局去重步驟確保了資料集範圍內的唯一性。所有篩選和修正操作都完全可稽核。 ### SFT 訓練細節 在經過「以 LLM 作為評審」、基於規則的篩選和全局去重管線後,我們使用約 410 萬個高品質樣本對基礎模型進行微調。以下細節適用於所有三種模型變體: 訓練配置: | 參數 | 值 | | --- | --- | | 運算資源 | 16 個節點,每個節點 4 個 GB200 | | 訓練週期 | 3 | | 學習率 | 5e-6(3% 線性暖身,約 25K 步驟線性衰減) | | 序列長度 | 16,384 個 token | | 總樣本數 | 約 410 萬 | | 有效批次大小 | 256 個樣本/迭代(約 420 萬個 token/迭代) | * * * ## 強化學習:多階段 RL 管線 在 SFT 之後,我們應用多階段強化學習管線,以進一步提升模型在特定領域的能力。
我們不是進行單次 RL 傳遞,而是運行多個目標性 RL 階段,每個階段都針對不同的能力進行優化。 ### 訓練方法 我們使用基於策略的 GRPO (群組相對策略優化)(Shao 等人,2024)搭配 DAPO (解耦裁剪與動態採樣策略優化) 損失函數(Yu 等人,2025)。



