Thinking Machines Lab (簡稱 Thinky) 似乎每隔幾個月才會有新動態,最近一次是推出互動模型。然而,每次他們現身,總能以其獨到的品味和深度令人印象深刻。今天,他們發表了 Inkling,這雖然不是一個最先進 (SOTA) 的模型,但卻是美國開源模型領域一個非常堅實的新系列。
他們的模型名為 Inkling,是一個專家混合 (Mixture-of-Experts, MoE) Transformer 模型,總參數達 9750 億,其中 410 億為活躍參數。它支援高達 100 萬個 token 的上下文視窗,並以 45 兆個文字、圖像、音訊和視訊 token 進行預訓練。
Inkling 是該系列中首個發布的模型,同時也預覽了 Inkling-Small,這是一個較輕量級的模型,擁有 120 億活躍參數,採用類似的訓練方法,能在更低的成本和延遲下實現強勁效能。
Inkling 能夠原生處理文字、圖像和音訊,並透過高效且可控的「思考努力」來平衡成本與效能。
Huggingface 的分析揭示了一些有趣的技術亮點。這份 AI 新聞報導涵蓋了 2026 年 7 月 14 日至 7 月 15 日的資訊,我們檢視了 12 個 Reddit 子版塊和 544 個 Twitter 帳號。
Thinking Machines Lab 推出了 Inkling,這是他們首個完整發布的開源權重基礎模型系列產品,將其定位為一個可客製化的多模態基礎模型,而非一個僅追求基準測試最高分的旗艦模型。
Thinking Machines 宣布 Inkling 是一個開源權重模型,能夠「在文字、圖像和音訊模態之間高效推理」,並提供完整的權重,同時在其 Tinker 平台和 Playground 上提供即時支援。Mira Murati 形容 Inkling 是該公司「第一個從頭開始訓練」的模型,具備開源權重,並可在 Tinker 上進行當日微調。
Soumith Chintala 則將其視為 Thinking Machines 的「第一個通用模型」,強調其開源權重、9750 億參數、原生多模態能力,以及在 Tinker、Hugging Face 和合作夥伴平台上的可用性。John Schulman 補充了時間線背景,指出預訓練始於去年冬天,並從一月中旬開始,一個小型團隊在其基礎上進行了程式碼、推理和代理式訓練。
Lilian Weng 將 Inkling 定義為一個旨在「在廣泛能力類別中實現穩固效能」的基礎模型,適用於實際應用和客製化。Thinking Machines Lab (TML) 的員工們也一再強調,這是一個首日發布版本,是未來迭代的基礎,而非他們的最終突破。
此次發布獲得了異常廣泛的「首日」生態系統支援,包括 vLLM、SGLang、Modal、Baseten、Databricks、Hugging Face 以及量化和社群工具等。
獨立評論員立即將其評為迄今為止美國最強大的開源權重模型,儘管在某些基準測試上仍落後於頂級的中國開源模型和最佳的閉源模型。大多數報導指出 Inkling 擁有 9750 億總參數和 410 億活躍參數,儘管有少數推文提到 9740 億或 9520 億,但普遍共識約為 9750 億。
它是一個專家混合模型,每個 token 有 410 億活躍參數,並採用 Apache 2.0 授權。Inkling 支援文字、圖像和音訊輸入,並輸出文字。開源權重檢查點支援高達 100 萬個 token 的上下文,而 Tinker/API 的上下文則為 256K,並針對 64K 和 256K 上下文提供不同的定價。
TML 表示 Inkling 是從頭開始訓練的。社群讀者從發布材料中提取出 45 兆個訓練 token 的數據,儘管有一篇貼文提到 48 兆,但此數據集中更常出現的數字是 45 兆。Inkling 還包含可控的推理努力/數值努力等級。
Tinker 的客戶強調其簡潔的推理能力和強大的工具呼叫功能,而非一味追求最高的原始基準分數。
幾位技術專家從發布內容中提取了其架構選擇:它採用混合/滑動視窗注意力機制,局部到全局層的比例為 5:1,視窗大小為 512。Inkling 使用相對位置編碼/相對注意力偏差而非 RoPE,許多發布者稱這是最具創新性的大規模選擇之一。在注意力/前饋網路 (FFN) 流周圍添加了短卷積層,評論者指出這是短卷積層不尋常的大規模應用。
專家混合模型 (MoE) 採用共享專家接收器/2 個共享專家,這被認為是非典型的,因為許多最近的 MoE 模型只使用 1 個共享專家。社群對該架構的解讀中提到了 DeepSeek 風格的無輔助損失負載平衡。從說明文件中推斷出 muP 和 Muon/權重衰減變體,並經優化器專家確認:Aaron Defazio 表示他們正在使用他修正後的權重衰減方法「MuonC/AdamC」,而社群讀者也指出了 muP。vLLM 強調了 8 個 MTP 頭用於推測解碼。
Inkling-Small 被多次提及為即將推出或單獨討論的較小型模型。社群摘要指出 Inkling-Small 總參數為 2760 億,活躍參數為 120 億,在多項評估中與較大型模型相比,表現出乎意料地具有競爭力。Artificial Analysis 表示,Inkling 在「智慧指數」上首次亮相便獲得 41 分,使其成為領先的美國開源權重模型,超越了 Nemotron 3 Ultra (38 分)、Gemma 4 31B (29 分) 和 gpt-oss-120b (24 分)。
Artificial Analysis 還指出,Inkling 在每個智慧指數任務中平均輸出 25K 個 token,相較於 GLM-5.2 max 的 43K、Kimi K2.6 的 38K 和 DeepSeek v4 Pro max 的 37K,這顯示其相對的 token 效率。
Natolambert 稱其為「Nemotron Ultra 的明顯提升」和「新的最佳美國模型」,但在代理式基準測試上仍「略遜於 GLM 5.2」,在多模態方面則「略遜於 Kimi K 2.6」。Design Arena 表示 Inkling 在「代理式網路應用競技場」中總體排名第九,Elo 分數為 1257,與 Claude Opus 4.6 和 Gemini 3.5 Flash 處於同一區間,並稱其為代理式工作負載中排名最高的美國開源權重模型。
Arena 在發布當天將 Inkling 添加到代理競技場/文字/視覺/程式碼競技場中。根據 Artificial Analysis 的數據,GDPval-AA v2 Elo 分數為 1238,高於 Kimi K2.6 (1190) 和 DeepSeek v4 Flash max (1189)。
τ³-Banking 達到 24%,高於 Kimi K2.6 (21%) 並略高於 DeepSeek v4 Flash max (23%)。
正面評價包括:推理「清晰簡潔」,不冗長。在代理式任務中具有強大的工具呼叫能力和良好的長期錯誤恢復能力。展現出良好的「思維品質」/不諂媚的風格。Alex Kirillov 聲稱 Inkling 避免了許多全能模型中常見的「音訊輸入 = 智慧懲罰」問題,儘管有另一位用戶要求提供更強的佐證和基準測試。
較為褒貶不一或批評的意見則指出:Scaling01 認為基準測試結果「沒那麼好」,形容它大致上是「另一個 Kimi-K2.6」,並且落後於所有閉源模型和 GLM-5.2,推測其發布可能是在 Kimi-K3 和 DeepSeek-V4-GA 之前搶先推出。
Stochasticchasm 表示它「對多模態來說非常強大」,但「對於終端基準測試等則沒那麼強」。JJitsev 反駁了關於「唯一未經蒸餾訓練的開源權重模型」的炒作,指出 Inkling 使用了開源權重的蒸餾技術,並且在 TerminalBench 類型的評估中表現不如 GLM 5.2。
TeortaxesTex 則提出了一個反向的正面觀點:平庸的基準測試最高分可能反而意味著更少的偷工減料/蒸餾污染,以及更獨立的數據管線。
NVIDIA 表示 Inkling 是在 GB300 NVL72 上訓練的,並且在發布當天 Hugging Face 上提供了 NVFP4 檢查點。vLLM 提到首日支援包括 NVFP4 和 BF16,針對 Blackwell 和 Hopper 進行了優化,在 4 個 GB200 上使用 MTP 可達到每用戶每秒 380 個 token 的速度。
Inferact 詳細說明了系統工作:sconv 感知張量並行分片、低延遲融合集合 (批次大小為 1 時速度快 5 倍),以及直接整合 TML 的 FA4 剪切偏差核心。LMSYS/SGLang 表示 Inkling 架構支援是原生實現的,包括 ShortConv、相對位置注意力、共享專家接收器 MoE、預填充完整 CUDA 圖、MXFP8 KV 快取、客製化 Megatron 後端的完整參數和 LoRA RL、路由重播、跨運行時參數同步,以及來自 Modal 的 DFlash 推測解碼。
Modal 表示 Inkling 在 Modal 上使用自訂的 DFlash 推測器,可將吞吐量和互動性提高 67%。Soumith Chintala 另外強調,Modal 的 DFlash 推測器「比 MTP 快得多」。Lysandre 報告稱,將 TML 的因果卷積一維層 (causal Conv1D) 替換為 causal-conv1d 可使每秒 token 數增加 4%,將注意力機制替換為 FlashAttention-4 又可增加 11%,總計在不重新訓練的情況下實現約 15% 的吞吐量提升。
Unsloth 發布了 1 位元 GGUF 量化版本,據稱體積縮小 86% (270GB 對比 1.9TB),同時保留了 74.2% 的前 1% 準確度,並支援視覺和音訊。
Artificial Analysis 列出了 Tinker 的定價:64K 上下文的輸入為每百萬 token 1.87 美元,快取為 0.374 美元,輸出為 4.68 美元;256K 上下文的輸入為每百萬 token 3.74 美元,快取為 0.748 美元,輸出為 9.36 美元。
Inkling 可在 Tinker、Hugging Face 以及包括 Databricks、Baseten、Modal、vLLM/SGLang 堆疊在內的合作夥伴平台取得。它發布了開源權重/完整權重,並從頭開始訓練。該模型是一個 9750 億總參數/410 億活躍參數的專家混合模型,支援文字、圖像、音訊多模態輸入,權重版本支援 100 萬上下文,Tinker/API 則支援 256K 上下文。
Inkling 採用 Apache 2.0 授權。預訓練始於去年冬天;代理式/程式碼/推理工作則從一月中旬開始。主要服務堆疊在發布當天即提供支援,vLLM/Inferact/Modal/NVIDIA 也提出了具體的效能聲明。儘管「最佳美國開源模型」/「拯救美國開源前沿」這些判斷被幾位受尊敬的觀察者重複提及,但關於 Inkling 特別重要的原因是因為它未經 OpenAI/Anthropic 蒸餾的說法存在爭議。
Jxmnop 稱其為「唯一」未經此類蒸餾的開源權重模型,隨後又部分收回:「顯然他們確實進行了蒸餾,但只是一點點」。Andrew Carr 也對其「純粹性」的說法提出異議,指出其在 SFT 追蹤中使用了 Kimi 2.5。批評者聲稱 Inkling 是為了搶在中國模型發布前「倉促推出」的說法純屬猜測,並未得到發布材料的證實。
關於相對注意力機制為 TML 帶來微調護城河的說法,因為反向傳播很困難,這也是推測性的。Inkling 避免多模態智慧損失的說法很有前景,但在推文集中尚未有完整的基準測試數據。開源權重和寬鬆的授權被視為一項戰略性勝利:許多人認為 Apache-2.0 的發布是對美國/西方開源生態系統的重大推動。
客製化優先於排行榜競爭:研究人員和開發者讚揚了 Inkling 被明確定位為一個廣泛、可調的基礎模型,而非一個僅追求基準測試最高分的點解決方案。強大的發布品質:幾位用戶讚揚了其透明度、務實的語氣和全面的技術文件。



