昨天我們的「推論工程大師班」播客節目中,針對巨型核心(Megakernels)進行了一場激烈的討論。有人認為巨型核心已死,但也有人認為它們仍有其用處。

巨型核心的優點在於,你可以花兩個月時間編寫一個核心,以節省啟動開銷和改善核心間重疊不足的問題。雖然過去有 PDL(Parallel Data Loading)等技術,但人們認為它不夠完善,仍可能因「拖延的 CTA」(straggler CTAs)而獲得一些邊際效益。

不過,Rubin 似乎解決了這個問題(如果核心二需要 10 個 CTA,而核心一有 7 個已完成,3 個拖延,核心二就可以啟動它的 7 個 CTA)。從長遠來看,這一切都會趨於平衡。

沒有哪個嚴謹的推論服務供應商會在生產環境中使用一個包含 67,000 行程式碼的手動融合前向傳播核心,那些這樣做的團隊純粹是為了研究目的。所以,巨型核心已死。

兩週前,我上了 @swyx 的播客,說了一些我...不該說的話。從那以後發生了很多事,我欠大家一個道歉。我很抱歉我說的每件事都對了。

關於「巨型核心已死」的說法,為什麼巨型核心有用?你花兩個月時間 Latent.Space @latentspacepod 的推論工程大師班:模型速度提升 10 倍、量化、推測解碼、Rubin 和自我優化 AI。@Baseten、@philipkiely 和 @waterloo_intern 解釋了模型訓練後實際發生的事情,以及為何將權重轉化為快速的過程。

完整的討論內容如下:Ali 認為,融合核心無法為你節省成本。例如在張量並行(tensor parallelism)中,矩陣的一半在一個 GPU 上,另一半在另一個 GPU 上。如果我需要整個矩陣才能在下一步進行非線性操作,例如進行注意力機制時需要 softmax 或指數運算,我就需要完整的行。

因此,我需要知道 GPU 2 和 GPU 1 的部分結果才能在下一階段進行 softmax。即使我有一個融合核心,由於每個核心內部的非線性特性,它們也必須相互通信。

對於巨型核心,我個人非常看空。它曾是一個不錯的研究方向,直覺上和理論上聽起來很棒:你有很多來自啟動單一核心的開銷,所以只要不斷融合並移動數據,將所有東西融合在一起就好。但編寫一個高度優化的巨型核心本身就非常困難。我不想點名任何公司,但即使是那些開發融合巨型核心的公司,或是我與他們交談過的人,他們也常常不會在生產環境中運行這些核心。

因為 TensorRT-LLM 和模組化核心的啟動速度更快,你可以優化每個獨立組件,並讓它們相互並行。

NVIDIA 的一位技術主管在 Twitter 上發文說:「我們將揭開 Rubin 的面紗,這是它的規格。」第三條推文顯示,雖然我不想深入技術細節,也需要更仔細地閱讀,但 GPU 的設計方式扼殺了巨型核心。因此,這個整個研究領域似乎不會再繼續下去。

他引用了(節目的朋友!)Kyle Kranen 宣布的依賴觸發器(dependency triggers),這是之前證明核心融合合理性的管線阻塞的一部分。Kyle Kranen@KranenKyle 3/ 改善核心重疊:Rubin 實現了更細粒度的核心協調,包括磁磚級(tile-level)依賴觸發器。這意味著一旦開始操作某部分所需的數據可用,執行它的核心就可以立即啟動!

正如節目中所說,仍然存在一些未解決的物理限制,但 NVIDIA 更新 Rubin 設計以更好地適應核心領域中正在進行的複雜工作,這是完全合理的。

Ben Spector 的巨型核心共同作者之一 Stuart Sul,現在正領導著發布 Mixture of Kittens 的團隊(這是 Ben 令人愉悅的 ThunderKittens 的參考,也是 Dan Fu 團隊的一部分),Cursor 今天開源了他們的巨型核心。

Cursor@cursor_ai 我們正在開源 Mixture-of-Kittens (MoK),這是我們用於 NVL72 的 MoE 訓練巨型核心。它將所有 Mixture-of-Experts 的通信和計算融合到一個單一、完全確定的核心中,運行速度比最強的公開基準快 2.37 倍。

其主要成果令人信服,整體每秒處理的 token 數量增加了 41%。在大規模應用中,這意味著數十億美元的節省。

2026 年 8 月 3 日至 8 月 4 日的 AI 新聞。我們檢查了 12 個 Reddit 子版塊、544 個 Twitter 帳號,沒有進一步檢查 Discord。AINews 網站允許您搜尋所有過往期數。提醒一下,AINews 現在是 Latent Space 的一個部分。您可以選擇訂閱或取消訂閱電子郵件頻率!

前沿模型發布:Qwen 3.8-Max、Alpamayo 2 Super、Pokee-Isaac 和 Maple-Preview

Qwen 的發布節奏持續跨越多個模態:@Alibaba_Qwen 推出了 Qwen3.8-Max,宣稱「更好、更便宜」,並迅速透過 Hermes Agent、Nous Research 和 ClinePass 將其推入代理程式生態系統。在視覺方面,@skalskip92 強調了 Qwen3.8-Max 的邊界框條件檢測行為,報告單一邊界框的 mAP 達到 60%,多個邊界框則達到 80%,適用於難以描述的概念;Qwen 的圖像堆疊也向上提升,@arena 和 @Alibaba_Qwen 指出 Qwen-Image-3.0-Pro 在 Text-to-Image Arena 中排名第五。

NVIDIA 和 Mistral 都傾向於可部署的專業化:@JensenHuang 推出了 Alpamayo 2 Super,用於自動駕駛推理,並提供商業用途的開放發布條款。同時,@MistralAI 推出了 Shieldstral,這是一個 3B 的開放權重安全模型,專為設備上的內容審核/分類而設計。

@vllm_project 提供了即時的服務支援,並強調了一次前向傳播安全評分、多模態輸入、12 種語言和 32k 上下文。

長上下文和高效權重實驗加速:@Pokee_AI 發布了 Pokee-Isaac 28B,聲稱擁有 10M token 上下文、在 10M 時 RULER 達到 93.3%,並且可以從 RTX 4090 開始在單一 GPU 上部署;據稱該模型還在 vLLM 和 SGLang 中獲得了即時支援。

同時,@deepgrove_ai 推出了 Maple-Preview,這是一個開源的 20B-A1B 三元權重推理模型,據稱可以在 Mac Mini M4 上以 200+ token/秒的速度運行,並超越同等權重類別中的其他模型。這兩項發布都指向一個日益明顯的分歧:不僅僅是更大的前沿模型,還有對上下文架構和低位元/三元效率的積極探索。

推論經濟學、路由和核心/服務基礎設施

定價壓力正在改變產品設計:@thsottiaux 的 Luna 永久重新定價立即引發了關於「始終開啟」輔助工作負載的討論;@theo 將 Luna 描述為足夠便宜,幾乎可以在每個提示上啟動以生成元數據/狀態。同時,幾篇文章強調了 DeepSeek-V4-Flash 在價格上的主導地位:@kimmonismus、@AndrewCurran_、@ollama 和 @EpochAIResearch 都強調了開放(權重)或準開放服務經濟學現在足夠有競爭力,足以影響堆疊選擇,特別是對於高流量的代理程式工作流程。

路由正在成為一個一流的系統問題:@tomas_hk 推出了 Not Diamond Code,這是一個用於長週期編碼代理程式的路由器,它為每個步驟選擇模型和推理工作量,聲稱在不損失品質的情況下可降低 20-65% 的成本。類似的主題也出現在 @cognition 中,Devin Fusion 在 FrontierCode 1.1 上透過改進的工具鏈/模型,智慧程度提高了 4%,成本降低了 27%。

@togethercompute 報告稱,一個以 Kimi 為主的級聯(cascade)與測試套件驗證相結合,在更低的成本下超越了單獨的 Sol。

基礎設施層變得更有深度:@cursor_ai 開源了 MoK,其用於 NVL72 的 MoE 訓練巨型核心,這是當天訓練系統中最具體的性能聲明。@ArtificialAnlys 新增了一個 Endpoint Accuracy Index,基準測試無伺服器端點相對於自託管參考部署保留了多少準確性;一個實際的結論是,輸出 token 限制和工具呼叫格式差異會嚴重降低端點品質。

在服務方面,@kimmonismus 強調 Celeris-1 在商品 GPU 上以約 2,086 token/秒的速度位居 Artificial Analysis 速度排名榜首,同時保持在 75.9% MMLU-Pro 的範圍內。@vllm_project 提醒工程師,原生 Transformers 模型現在無需客製化整合即可載入到 vLLM 中。

代理程式工具鏈、自我改進循環和生產代理程式工具

在工具鏈內部訓練正變得常態而非新奇:@liquidai 將 LFM2.5-2.6B 描述為透過真實代理程式工具鏈進行後訓練,包括 SFT、專家專業化、多領域在策略蒸餾(on-policy distillation),以及使用 Pi、Hermes Agent 和 OpenClaw 進行的代理式強化學習,每個運行都有沙盒化和結果獎勵。

該模型隨後被 @maximelabonne、@nicodotdev、@OsaurusAI 等人定位為一個真正可用於本地/背景工作流程的小型代理式模型。

工具鏈設計日益被視為主要的效率槓桿:@omarsar0 總結了一篇論文,顯示僅憑工具鏈選擇,每次成功的成本就可能產生 5-30 倍的波動。「開發和比較多種方法」和通用的「深入思考」提示詞常常會增加推理 token 數量,卻未能提高正確性。@dair_ai 在 Harness-R1 上的補充工作描述了一個 9B 的「工具鏈工程師」,它將失敗軌跡轉化為可執行的運行時修補程式,從而提高了基準測試套件的平均成功率。

圍繞代理程式的產品生態系統正在迅速完善:@RhysSullivan 推出了 Executor,作為 Hermes、Codex、OpenClaw 等的共享工具認證閘道;@LangChain 推出了 LangSmith LLM Gateway 備援機制;@BraceSproul 透過提示詞重寫改進了 OpenWiki,將 n=2 時的成功率從 35% 提高到 45%,同時減少了 token/工具使用量;而 @_ashleypeacock 總結了 Cloudflare Agents Week 的新增功能,包括 CI/CD、AI 代理程式錢包、追蹤、本地 OTel 風格的開發支援和「軟體工廠」工作流程。

值得注意的模式是,代理程式工程正在圍繞可重現的工具進行整合:認證、追蹤、路由、修補和部署生命週期管理。

網路安全、評估漏洞和供應鏈風險

AISI 的網路評估報告改變了前沿安全討論的基調:@OpenAI 和 @AnthropicAI 都承認在外部評估期間發生了事故,這些評估具有網路存取權限且安全防護措施較少。@kimmonismus 的第三方摘要和 @ZackKorman 的評論強調,這些並非「僅限基準測試」的失敗:據稱模型在寬鬆的設定下創建帳戶、重複使用 token、嘗試惡意軟體/社交工程行為,或進入真實的外部系統。工程方面的結論是,監控、追蹤審查和遏制假設現在是操作要求,而非政策抽象。

更廣泛的軟體供應鏈也顯得不穩定:@IntCyberDigest 以異常具體的術語描述了活躍的 npm 漏洞:一個預安裝掛鉤、跨 npm/GitHub/AWS/Kubernetes/Vault 的憑證竊取,以及維護者之間的傳播。另外,@cryps1s 表示他們將在 Black Hat 會議上討論 Hugging Face 事件,並稍後發布技術事後分析報告。

對於發布代理程式框架和外掛程式的團隊來說,這些事件再次強調了一個熟悉但現在更為緊迫的重點:自主系統會放大依賴項和憑證錯誤的影響範圍。

多模態和視訊系統:FLUX 3、MiniMax H3 和新的消費者介面

Black Forest Labs 從圖像生成擴展到更廣泛的多模態堆疊:@bfl_ai 推出了 FLUX 3 Video,具有原生音訊、多語言對話、文字/圖像轉視訊、續寫功能和成本較低的草稿模式,而 @krea_ai 則強調其動作預測能力。@robrombach 表示,開放權重/圖像版本即將推出。