2026 年 8 月 13 日至 8 月 14 日的 AI 新聞。我們檢閱了 12 個 Reddit 子版塊、544 個 Twitter 帳號,並未發現新的 Discord 討論。AINews 網站提供過往所有期刊的搜尋功能。提醒您,AINews 現已成為 Latent Space 的一個專區,您可以自由選擇電子郵件的接收頻率。
Z.ai 推出了 GLM-5.3,這是本期最大的技術新聞。該模型定位為專注於程式碼和網路安全,透過對 GLM-5.2 所使用的相同 743B 基礎模型進行後訓練而非全新預訓練而建構。
Z.ai 及其後續貼文聲稱在代理(agentic)和安全評估方面取得了顯著進展,包括 Terminal Bench 3.0 達到 28.3 分,DeepSWE 達到 66.9 分等。該公司還表示,網路安全能力已大幅提升,因此初期僅限特定合作夥伴使用,待安全審查後才會開放權重發布。許多工程師強調的關鍵點是,這次能力飛躍完全來自於對長週期可執行任務的規模化後訓練/強化學習,而非更大的基礎模型。
阿里巴巴發布了 Qwen3.8-27B,這是一個在 Apache 2.0 授權下的原生多模態密集模型,具備 262K 的原生上下文長度,透過 YaRN 可擴展至 1M。同時,他們也強調了已發布的 Qwen3.8-2.4T-A95B 頂級模型。
27B 模型之所以引人注目,是因為它明確定位於實際的程式設計、辦公工作流程和代理應用,而不僅僅是學術基準測試。發布當天的推論支援異常廣泛,包括 vLLM、Ollama、llama.cpp/GGUF 等,其中 SGLang 報告在單張 RTX 5090 上達到每秒 206 個 token。
實際部署細節在此次發布中顯得尤為重要:Unsloth 聲稱支援 NVFP4 和動態 GGUF 建構,而 Qwen 則強調 27B 模型僅需 17GB 記憶體即可在本地使用。
DeepSeek V4-Pro 和 RedNote 的 dots3-note 持續推動中國開放模型浪潮。vLLM 宣布支援 DeepSeek-V4-Pro,並特別指出其 MIT 授權、與預覽路徑的檢查點相容性以及整合的草稿支援。
同時,RedNote 的 AI 實驗室發布了 dots3-note Preview,這是一個 280B 的多模態 MoE 模型,擁有 16B 的活躍參數和 512K 的上下文,旨在用於長時間運行的代理,並伴隨一種新的強化學習方法 TEMPO,用於長週期自我評估。
這種新興模式顯示出多家中國實驗室正在專業化發展:評論員明確指出 Z.ai、DeepSeek、月之暗面(Moonshot)、Qwen、MiniMax 和 RedNote 構成了一個快速發展的開放生態系統,各具獨特優勢。
DeepSeek Harness 被視為基礎設施而非演示代理。這次發布引發了更多關於執行時架構而非模型使用者體驗的討論。多篇深度分析描述該 Harness 為一個可插拔的代理執行時,其中代理迴圈、工具、會話、檔案系統和提供者都是可替換的。Cordis 負責生命週期管理、反應式依賴和可逆效果。
技術上有趣之處不僅在於「模組化」,還在於支援熱插拔執行時組件,並可能讓代理在不重啟的情況下修改自己的執行時,同時保留可稽核的事件日誌並避免隱藏狀態。多位開發者反應,目前的 Harness 可能「不正確」,或者至少與這個方向相比,其核心過於固定。
Harnesses 本身正成為優化目標。一些貼文強調,基準測試和產品的進展越來越多地來自於支架/Harness 層,而不僅僅是基礎模型的智慧。DAIR 突出了 AutoDesign 專案,其中一個元優化器根據運行回饋重寫 Harness 本身;他們報告在從論文到海報生成以及跨代理/模型配置的轉移方面取得了進步。
Lambda 的 Tetris 實驗從相反的角度說明了類似的觀點:提示詞放置、設定和沙盒限制顯著影響了結果,代理會利用基準測試漏洞,除非受到嚴格限制。這與更廣泛的討論相符,即可觀察性數據現在兼具評估、記憶和學習基底的多重作用。
新的評估方法針對實際的代理失效模式。Vals 推出了一個代理逆向工程基準測試,專注於網路安全相關二進位設定中的確定性最終目標,而非中間產物;一篇配套文章指出,當原始碼可用時,目前的頂尖代理比必須對二進位檔進行推理時要強大得多。
OpenRouter 引入了針對工具輔助代理的網路搜尋基準測試,而 Ai2 的 TutorMoments 則被引用為一個基於重播的輔導評估,顯示模型常常過度幫助,而非鼓勵富有成效的掙扎。
評估反彈持續不斷。一個反覆出現的主題是對供應商基準測試聲明的懷疑。Vik Paruchuri 批評了 LlamaIndex 的一個基準測試,稱評分器錯誤可能使系統從 65% 提升到 93.6%,並明確主張開發者應該運行自己的評估,而不是相信行銷說辭,「包括我們自己的」。
François Chollet 重申,公開的 ARC-3 演示集既不是訓練也不是評估數據,其排行榜分數只是私人集性能的弱代理。Meta 的 Wiggle Framework 也是一個值得注意的補充,Omar Sar 強調它在重新提示和對抗壓力下對 LLM 評審進行壓力測試,發現判決在靜態反駁下可能翻轉 25–71%,在對抗性說服者下則為 62–91%。
服務優化日益成為一流的模型功能。Qwen 和 DeepSeek 的發布當天基礎設施支援強調了嵌入式草稿頭、推測性解碼以及記憶體/量化權衡等,而不僅僅是 API 存取。
Qwen 的 27B 版本發布時提供了關於 MTP 草稿頭、1M 上下文以及在單個 Blackwell GPU 上服務的 vLLM 指導,而 ggerganov 展示了用於大上下文和推測性解碼的本地 llama.cpp 配方。Tim Dettmers 預告了即將推出的效率方法,可在單個 DGX Spark 或 AMD Strix Halo 上運行強大模型,解碼速度約為每秒 7 個 token,預填充速度超過每秒 250 個 token。
工具和叢集操作也獲得了實用更新。Stas Bekman 為診斷 PyTorch 中掛起的 NCCL collective 呼叫提供了指導,並另外指出 Python 3.14+ 允許在不進行儀器化(instrumentation)的情況下將 pdb 附加到正在運行的進程。
Turbopuffer 描述了一個客製化的控制平面,用於操作 100 多個 TPUf 叢集,包括客戶雲端中的 BYOC 部署,無需直接主機存取。在數據方面,Hugging Face 的 datatrove 0.10.0 版本增加了用於 Hugging Face Jobs 的 JobsPipelineExecutor、HF 儲存桶整合以及保留推理輸出。
Cursor 併入 SpaceXAI。Cursor 宣布成為 SpaceX 的一部分,其團隊將加入 SpaceXAI,共同開發 Grok、Grok Build、Grok Bot、Grok API 和 Cursor,這是當天最受關注的技術/企業動態。
SpaceXAI 證實了這項收購,並將其定位為首先加速軟體工程,然後是更廣泛的知識工作。這是一個明確的跡象,表明程式設計代理團隊現在被視為戰略性的模型/平台資產,而非狹隘的 IDE 產品。
Gemini 3.7 Flash 廣泛推出,專注於代理和實用經濟性。Google 將 Gemini 3.7 Flash 廣泛推向 Gemini 應用程式、Search AI 模式、Google Workspace / Sheets canvas 和 Spark。
其定位是「迄今為止最智能的程式設計和代理工作主力模型」,演示重點是將簡單的提示詞轉化為可玩的網頁遊戲。外部評估訊號雖然溫和但積極:Vals 將其在 Vals Index v2 上排名第 7,得分 59.4%,較 Gemini 3.6 Flash 的第 14 名有所提升。
Claude Code 和本地代理使用者體驗日益實用化。Anthropic 為 Pro/Max/Team 用戶在 Claude Code 中將自動模式(Auto mode)設為預設權限模式,並透過 /auto-mode-setup 進行儲存庫感知設定,以建議受信任的儲存庫/網域。
在開放/本地端,Hermes 增加了 /loop 功能,用於代理會話內的類似 cron 的重複操作,而 Nous 指出 Hermes Desktop 可以針對 Hermes Cloud 代理,讓工作在關閉筆記型電腦後仍能繼續。Ollama 也增加了對本地啟動 DeepSeek Harness 的支援。
Cursor 併入 SpaceXAI:Cursor 的收購公告是當天最受關注的科技推文,預示著程式設計代理和垂直整合模型/產品堆疊的持續整合。
GLM-5.3 發布:Z.ai 的 GLM-5.3 推出是頂級模型發布推文,主要因為它強化了後訓練和長週期強化學習可以從已訓練的前沿基礎模型中釋放巨大潛在能力的論點。
Qwen3.8-27B 開放權重:阿里巴巴的發布引起了廣泛關注,因為一個 27B 的本地多模態模型現在被宣傳為可用於嚴肅的代理/專業工作,並獲得了廣泛的發布當天支援。
實用程式設計代理的勝利:redp314 的「Claude Code 透過兩個提示詞從 800 個檔案中建立了一個 DICOM 檢視器」,作為程式設計助理在基準測試之外的實際應用天花板的一個強大範例。
Qwen3.8-27B 初步模型卡已上線!評論者強調該模型卡中聲明的原生 262,144 token 上下文長度,以及可擴展至 1,000,000 token,是 Qwen3.8-27B 最具技術亮點的規格之一。
人們對架構/產品線差異很感興趣:據報導,27B 模型包含視覺支援,而更大的 2.4T 模型則沒有,這讓用戶從能力擴展的角度感到驚訝。一位評論者指出,模型卡中沒有明確提及 QAT / 量化感知訓練,並將其與 Gemma 4 31B 進行比較,後者認為 QAT 能顯著提高量化模型的性能。其他人也指出「推理努力」(reasoning effort)是近期模型卡中一個新興的調優/控制功能。
Qwen3.8-27B 與 Qwen3.6-27B 完全相同!圖片顯示 Qwen3.6-27B 和 Qwen3.8-27B 的架構圖在視覺上完全相同:相同的視覺/嵌入路徑、遮罩散射、重複的 Qwen3_5DecoderLayer 堆疊、RMSNorm、最終線性層和輸出。
連結的 Hugging Face Viewer 差異報告顯示沒有架構變化,支持了該貼文的說法,即 Qwen3.8-27B 的任何能力提升可能來自於訓練/數據/微調更新,而非模型架構變化。
評論者將此視為增量更新而非從頭開始的模型,其中一人指出訓練數據通常是最大的品質槓桿。另一位推測,熱插拔的 LoRA 風格適配器可能會流行起來,以提高本地模型在專業任務上的準確性。



