一個僅有30億參數的中文語言模型,在數學和程式編碼任務上,有時能與參數多達百倍的模型匹敵。其背後的研究人員已針對人工智慧能力的結構,提出了一項假說。
微博的母公司新浪,發布了一款小型語言模型,能在艱難的數學和程式編碼任務上,與當今頂級模型競爭。根據技術報告指出,VibeThinker-3B在AIME26等競爭性基準測試中,表現與DeepSeek V3.2和Kimi K2.5不相上下。而後兩者的參數數量,卻是VibeThinker-3B的200到333倍。
新浪將此模型定位為一項實驗,旨在探究模型要達到頂尖競爭力,實際需要多少運算資源。其前身VibeThinker-1.5B已於2025年11月推出。新版本則更進一步,探討小型模型是否能達到真正的頂級性能,而不僅僅是「以其規模而言表現良好」。
在六項數學和程式編碼基準測試中,這個30億參數模型(橘色)的表現,落於包含Gemini 3 Pro、GLM-5和Claude Opus 4.5在內的五個當前頂級模型的性能範圍內。
這些結果揭示了兩種截然不同的情況。在具有明確可驗證解決方案的結構化任務上,例如數學奧林匹亞競賽或程式設計挑戰,VibeThinker-3B的表現與GLM-5或Gemini 3 Pro等模型相當。在LiveCodeBench上,它甚至超越了所有參數小於200億的模型。
然而,事實知識則是另一回事。在知識密集的GPQA-Diamond基準測試中,該模型遠遠落後於其規模大得多的競爭對手。
儘管VibeThinker-3B的規模小了數百倍,但在IMO-AnswerBench上,它幾乎與DeepSeek V3.2、GLM-5和Kimi K2.5的表現相當。
為排除資料污染的可能性,研究團隊讓模型參與了2026年4月底至5月底舉行的LeetCode競賽,此時模型訓練已完成。VibeThinker-3B在首次嘗試中解決了128個問題中的123個。這使其表現超越了GPT-5.2、Qwen3-Max、Kimi K2.5和Claude Opus 4.6。它僅略微落後於GPT-5.3-Codex、Gemini 3.1 Pro和Gemini 3 Flash。
VibeThinker-3B建立在阿里巴巴的Qwen2.5-Coder-3B基礎上。新浪的貢獻在於「後訓練」(post-training),也就是在大型資料集上進行通用預訓練之後的所有步驟。根據報告,正是這些後訓練讓一個30億參數的模型,能夠接近頂級表現者。
後訓練分階段進行。首先,模型透過監督式微調(supervised fine-tuning)學習廣泛的任務,涵蓋數學、程式編碼和一般對話。接著,它會針對困難的多步驟推理問題進行客製化。
隨後是強化學習(reinforcement learning),依序應用於數學、程式設計和STEM領域。接著,自我蒸餾(self-distillation)將每個階段的技能整合到單一模型中。最後一步則確保模型能更好地遵循指令。
正是後訓練實現了性能的飛躍。這包括兩階段的監督式微調、針對數學、程式碼和STEM領域的多階段推理強化學習,以及最後一個用於提示詞遵循的指令階段。
在微調過程中,團隊刻意建立了多樣化的解決方案路徑。強化學習隨後會強化那些有效的路徑。這項論點指出,性能提升來自於訓練方法、資料品質和可靠的驗證訊號,而非僅僅是增加參數數量。
基於這些結果,作者提出了他們稱之為「參數壓縮覆蓋假說」(Parametric Compression-Coverage Hypothesis)。不同的AI能力具有不同的結構,因此需要不同數量的參數。
邏輯推理,例如逐步解決數學問題,依賴於少數重複的模式,像是搜尋、檢查條件、糾正錯誤和組合中間結果。這類技能可以被壓縮到一個緊湊的核心中。然而,世界知識的運作方式則不同。回答許多主題的開放式問題需要廣泛的覆蓋範圍,這意味著需要大量的參數來儲存大量的知識。
研究人員表示,這重新定義了小型模型的用途。它們不僅僅是為預算有限的推論而設計的廉價輕量級版本,而是一條與傳統擴展邏輯並行的獨立研究路徑。在任務可驗證且具有清晰解決方案結構的情況下,參數數量不再是瓶頸。
VibeThinker-3B已在Hugging Face和GitHub上開源提供。
小型模型在特定任務上追趕上大型系統,正逐漸成為一種趨勢。今年四月,阿里巴巴的Qwen3.6-27B在所有程式編碼基準測試中,超越了其規模大15倍的前身。根據製造商表示,來自阿布達比的Falcon H1R 7B也達到了其規模兩到七倍模型的性能水準。早期關於小型模型邏輯缺陷的研究曾指出,它們通常在多步驟推理上會遇到瓶頸。VibeThinker在可驗證任務上的結果,恰好挑戰了這一假設。



