在 AI 世界中,時間的流逝似乎被壓縮了。在我們半年度分析的春季報告發布幾個月後,我們觀察到截至今年夏季的許多新發現。本報告闡述了從 2026 年 1 月到 8 月的這些觀察結果,並呈現了每個觀察背後的數據。
Hugging Face Hub 上的模型和資料集每天都在增長。在此期間,公開模型儲存庫從 243 萬增長到 296 萬,資料集從 71.1 萬增長到 100 萬,Spaces 從 100 萬增長到 144 萬。然而,底層分佈仍然極端,大約 85.6% 的模型終身下載量少於 200 次,而 1.5% 的儲存庫佔所有下載量的 99.2%。以下所有觀察都發生在這個分佈形態之內。
1. 前沿發展迅速
過去曾有一條清晰的發展路徑:實驗室會先發布較小的模型,然後逐步向上發展到規模最大的模型。但在 2026 年,幾家中國實驗室完全跳過了這個進程。
在 2026 年的幾乎每個月,中國實驗室發布的最大、性能最好的開放模型都比任何美國實驗室自行發布的模型更大。中國的每月上限介於 7540 億到 2.78 兆參數之間;而美國的上限在七個月中有五個月保持在 1300 億以下,例外是 NVIDIA 在 5 月和 6 月發布的 Nemotron 3 Ultra (5610 億參數),以及 Thinking Machines Lab 的 Inkling。
圖表將這些實驗室分為兩類。Moonshot、MiniMax、小米和 Z.ai 幾乎不發布 700 億參數以下的模型,因此開發者首次接觸它們時,模型規模都大到無法在他們自己的設備上運行。而騰訊和阿里巴巴的 Qwen 則涵蓋了從 10 億以下到更大的整個範圍。
有兩件事促成了第一類實驗室的出現。首先,建立大型模型不再是差異化的關鍵。小米和美團今年都突破了兆級參數,而十二個月前它們在開放權重領域還不是家喻戶曉的名字。其次,實驗室不再需要發布小型模型才能被接觸到,因為社群的量化層會在幾天內讓大型模型變得可運行,這一依賴性我們稍後會再討論。
這使得模型規模的設定成為一種意圖聲明,而非能力展現。專注於前沿模型的產品組合將一切押注在基準測試排名和 API 需求上。而提供全系列模型的產品組合,則是為了成為開發者標準化的家族模型。兩者都是理性的,它們追求的是不同的目標。
與此同時,美國也並非缺席開源領域。
今年發布最多新開放模型的兩個組織,同時也是製造硬體的公司:AMD 和 NVIDIA。它們各自發布了超過 200 個新的模型儲存庫,遠超其他競爭者,LiquidAI 以約 100 個模型儲存庫排名第三。硬體供應商已經意識到,開放模型是銷售晶片的一種方式:一個針對自家硬體優化且免費提供的模型,是證明硬體效能最明確的證據。
如果將小型模型和嵌入模型也納入考量,Google、Microsoft、IBM Granite 以及 OpenAI 較早期的視覺和語音模型每年產生數億次的下載量,美國在開源 AI 領域的參與度仍在增長。
然而,重心已經轉移。Google 和 Meta 在新模型發布數量上現在遠低於 NVIDIA,儘管它們在過去幾年曾是定義開放模型發布的公司。Meta 轉向閉源旗艦模型的舉動,進一步凸顯了這一變化。開源的重心已從模型實驗室轉移到硬體和基礎設施公司。
在前沿規模方面,情況則大相徑庭。今年美國發布的超過 1000 億參數的模型,大多不是新模型,而是基於中國模型構建的。在這個規模上,只有少數幾個主要的美國原創模型出現:Thinking Machines 的 Inkling (9520 億參數)、NVIDIA 的 Nemotron 3 Ultra (5610 億參數)、Nemotron 3 Super (1240 億參數),以及 Arcee AI 的 Trinity-Large (3990 億參數)。
AMD 貢獻了許多轉換工作,但在這個規模上沒有原創模型。這項工作仍然很重要:它使得兆級參數的中國模型能夠在美國硬體上高效運行。但這代表的是一個分發和優化層,而非模型創建。
同時,中國的開放模型也越來越多地針對國內晶片進行優化,這是一種反向的競爭,模型是圍繞特定的硬體生態系設計的。
2. 關注度不等於採用率
我們統計了今年累積下載量前 25 名的模型儲存庫,以及按按讚數排名前 25 名的模型儲存庫。結果只有一個儲存庫同時出現在這兩個榜單上。
我們計算的是在統計期間內的下載量,而不是終身下載量,因此沒有模型僅因存在時間較長而獲得優勢,控制了發布時間後,這種差異變得更加明顯。2026 年發布的模型中,沒有一個進入下載量前 25 名,而前 25 名中有 13 個模型發布於 2022 年。all-MiniLM-L6-v2 在七個月內被下載了 15.5 億次,卻只有 5,156 個讚;Kimi-K3 大約每收到一個讚就被下載 60 次。
這兩個數字記錄了不同的行為。按讚表示一個發布很重要,通常發生在前沿模型發布後的幾週內。下載則表示某個模型被整合到按計畫運行的管線中,並在數年內累積在小型、穩定的模型上。按讚是衡量業界對什麼感到興奮的正確工具,而下載則是衡量業界目前依賴什麼的工具。將其中任何一個視為另一個的替代指標,是我們在 Hub 報導中最常見的錯誤,包括我們自己早期的工作。同樣的差異也出現在發布者層面。
中國的前沿實驗室是 Hub 上唯一大型模型下載量佔比高的帳戶。MiniMax 在 2026 年的下載量幾乎全部來自 700 億參數以上的模型,Moonshot 佔 88%,DeepSeek 佔 55%,Z.ai 佔 39%。沒有一個大型美國帳戶呈現這種情況:Google、Microsoft 和 IBM Granite 在 2026 年的下載量中,幾乎沒有來自 700 億參數以上的模型,NVIDIA 和 Meta 分別只有 14% 和 9%。
在總下載量方面,這種差異更加明顯。Moonshot 僅專注於前沿模型的產品組合,今年錄得 3700 萬次下載,而 Qwen 涵蓋多種模型尺寸的廣泛發布策略則達到了 20.45 億次(在宣告參數數量的儲存庫中,包括所有儲存庫則為 20.61 億次),約是前者的 55 倍。
Qwen 家族的持續擴展,從 2.4 兆參數的 Qwen 3.8 Max 到 270 億參數等較小變體,顯示了其對涵蓋不同使用情境的相同關注。
時間也扮演著重要角色。大多數模型在發布後使用量會急劇下降,隨後是長時間的穩定活躍期。一個模型的採用率主要在其發布後的前幾個月內確定。
這有助於解釋為什麼今天的下載量通常不是由最新發布的模型驅動,而是由一小部分隨著時間推移已成為既有基礎設施的模型所驅動。
3. 開放權重改變價值累積模式
如果前沿模型是一種授權業務,你會預期最大的發布會附帶最嚴格的條款。然而,下面的數據顯示了不同的情況。
今年中國發布的 178 個超過 200 億參數的模型中,59% 採用 Apache 2.0 授權,22% 採用 MIT 授權,並且沒有一個帶有非商業限制。
DeepSeek 和 Z.ai 發布的 7000 億到 1.65 兆參數的模型都採用純粹的 MIT 授權。中國實驗室對其最大模型的授權條款,與對其最小模型的授權條款一樣寬鬆,甚至比美國實驗室對其同等規模模型的授權更寬鬆:在美國方面,同等規模的模型中,29% 採用 Apache 或 MIT 授權,41% 採用自訂條款,30% 則完全沒有聲明。
無論這些發布的目的是什麼,都不是為了授權收入。模型權重以最寬鬆的條款免費提供。回報必須來自其他地方:API 和雲端業務、硬體和平台定位,或是生態系本身的地位。例如,Z.ai 和 Kimi 的估值表明,有效的開源策略能夠在社群中獲得關注和增長機會。然而,未來產業可能會轉向更明確的開源採用貨幣化途徑。
4. Qwen 成為社群的基礎模型
一個模型在生態系中的地位不僅由其自身的發布決定,還取決於社群在其基礎上構建了多少。如上所述,Qwen 是一個例外,它同時獲得了關注和採用。
Hugging Face 的數據顯示,Qwen 已成為開放模型生態系中最大的基礎之一。基於 Qwen 的模型現在在 Hub 上有 151,448 個衍生模型,是 Meta 總數的 2.6 倍,Llama 專屬儲存庫的 4.7 倍。Google 緊隨其後,擁有 82,506 個衍生模型。第三大來源是 Unsloth,這是一個社群帳戶,發布量化和可微調的版本,其中許多進一步擴展了 Qwen 生態系。
在 2026 年的前七個月中,Qwen 衍生模型以每天約 180-210 個新儲存庫的速度增長,這表明採用率不僅僅是由單一發布所驅動。Qwen 已成為開發者決定微調和部署模型時的預設工作流程的一部分。
有幾個因素促成了這一地位。首先是一致性。Qwen 保持了規律的發布節奏,持續更新其模型家族,而不是依賴偶爾的旗艦發布。其次是覆蓋範圍。它發布了涵蓋廣泛尺寸和使用情境的模型,讓開發者無論需要小型本地模型還是大型部署模型,都能留在同一個生態系中。第三是開放性。Apache 2.0 授權減少了修改、再分發和商業使用的摩擦。
這些因素相互強化。廣泛的模型家族吸引更多開發者;更多開發者創造更多衍生模型;而這些衍生模型使生態系對未來的用戶更具吸引力。
這個地位主要是由社群建立的。151,448 個衍生模型代表的是其他開發者創造的下游工作,而不是 Qwen 自己生產的發布。即使在 Hub 上 28,531 個 Qwen 模型的 GGUF 轉換版本中,Qwen 自己也只發布了 54 個。
5. 小型模型仍是實用層
在宣告參數數量的模型中,10 億參數以下的模型佔所有歷史下載量的 83%,而 1000 億參數以上的模型僅佔 1%。如果僅限於 2026 年累積的下載量,情況也沒有改變:只有 3% 的下載量流向 700 億參數以上的模型。這是 3 月份的發現,至今仍最為清晰地成立,原因與之前相同:小型模型是大多數開發者實際擁有的硬體上唯一能運行的模型。
那麼,一個兆級參數的模型是如何觸及任何人的呢?透過 llama.cpp。
2 月份,ggml 團隊加入了 Hugging Face,該專案仍然完全開源、由社群治理並保持相同的技術方向。改變的是,本地推論領域最重要的專案現在有了持久的資源支持。
llama.cpp 推動了上限的提升。7 月份的快照顯示,DeepSeek-V4-Flash 的 GGUF 版本約為 2840 億參數,Kimi-K3 約為 2.8 兆參數。過去,本地推論意味著在筆記型電腦上運行一個 80 億參數的模型。現在,它意味著一個兆級參數的專家混合模型可以分散在幾台消費級機器上運行,這是前沿模型在一年前沒有的替代途徑,也是前沿優先發布策略得以實現的原因。
而這條途徑正是透過 Qwen 實現的:每月 3960 萬次 GGUF 下載量,幾乎是 Gemma 2080 萬次的兩倍,更是 Llama 750 萬次的五倍多。Llama 的差距並非供應問題,Llama 衍生模型的 GGUF 儲存庫數量略多於 Qwen。同樣的貨架空間,卻只有五分之一的流量。
模型儲存庫在這七個月內增長了 21.5%。而圍繞它們的幾項技術則增長了數倍。
宣告使用 gguf 函式庫的儲存庫增長了 464%,lerobot 增長了 194%,Apple 的 mlx 增長了 148%,而 transformers 和 peft 增長了 16%,diffusers 增長了 21%。建模核心是 g

