在 AI 新聞領域,談論開源模型總帶有些許不安:它們常以驚人姿態登場,在知名基準測試中表現亮眼,但一個月後卻銷聲匿跡,彷彿從未存在。換句話說,它們只是「基準測試的王者」。Latent Space 不希望報導那些您很快就會忘記的新聞。讀者告訴我們,他們喜歡 AINews 的其中一項政策是,如果今天沒什麼大事發生,我們會直接告知(這種告訴你可以跳過內容的電子報實屬罕見,部分原因在於我們並非以點擊率為導向的商業模式)。
我們也越來越常反向操作,反覆指出一個值得注意的趨勢,與過濾掉低信號的內容同樣重要。
GLM 5 通過了這個門檻,但 GLM 5.1 沒有。我們兩天前報導的 GLM 5.2 感覺有些不同,而今天這個直覺得到了證實,多個樣本外數據點都通過了「這是一個碰巧開源的前沿模型」的實測考驗。Jeremy Howard,一位不愛炒作的朋友,真誠地稱讚了它。
Artificial Analysis 的新知識工作基準測試也將其評分高於 GPT 5.5,並且它正在通過 /r/LocalLlama 的實測考驗。
智譜 AI (Z.ai) 獲得驗證,成為一個真正的前沿實驗室,這條發展軌跡如今已成為一個重要的趨勢。中國開源模型最終勝利的里程碑,將是我們何時能獲得一個 Fable 級的開源模型,且沒有被蒸餾攻擊的可能性(智譜 AI 顯然不在 Anthropic 二月份「工業規模蒸餾」報告中被指控的中國實驗室名單之列)。
一個棘手的問題是,沒有人能回答:未來六個月內,四大頂尖實驗室中是否還有任何一家能夠再次發布 Fable 級模型,還是說持續的 Mythos 禁令已讓一切停滯不前?
這是 2026 年 6 月 17 日至 6 月 18 日的 AI 新聞。我們檢查了 12 個 Reddit 子版塊、544 個 Twitter 帳號,但沒有進一步的 Discord 資訊。AINews 網站允許您搜尋所有過往的期刊。提醒您,AINews 現已成為 Latent Space 的一個專區。您可以選擇訂閱或取消電子郵件頻率!
GLM-5.2 成為當天開源模型的共識焦點:多位實踐者獨立描述智譜 AI 的 GLM-5.2 是第一個在日常使用中,感覺確實具備前沿模型潛力的開源模型。@rasbt 強調了其架構變化:除了繼承自先前 GLM/DeepSeek 風格設計的 MLA 和 DSA,GLM-5.2 還新增了 IndexShare,透過在多層之間重複使用稀疏注意力 (sparse-attention) 的 top-k 索引,以降低 1M token 推論的成本。
社群情緒異常強烈:@jeremyphoward 稱其在個人使用上「至少與 Opus 4.8 和 GPT 5.5 一樣好」,但也指出其主要不足是缺乏視覺支援;@matvelloso 說這是第一個達到他「日常主力」標準的開源模型;@ArtificialAnlys 在一項新的代理式知識工作評估中,將其定位在 GPT-5.5 和 Opus 4.8 之間。
智譜 AI 也積極推動其可用性:在有限時間內透過 Hugging Face Inference Providers 免費提供,支援 llama.cpp/Unsloth 的本地 GGUF 格式,並且根據 @ZixuanLi_ 的數據,其內部任務的應用開發表現從 GLM-5.1 的 21/70 大幅提升至 48/70。
其他開源模型發布也值得關注:@poolsideai 在 Apache 2.0 許可下發布了 Laguna M.1 權重,支援 256K 上下文;@vllm_project 將其描述為一個 70 層稀疏 MoE 模型,總參數 225B / 活躍參數 23B,256 個專家,top-k=16,針對長週期代理式編碼進行優化,具備交錯推理/工具使用能力。
Poolside 後來展示了在 M3 Max 128 GB 機器上,使用 Apple Silicon 進行 3 位元 MLX 建構,速度約為 26 tok/s,峰值記憶體約 100 GB。在較小模型方面,@cohere 推動了 North Mini Code 的可訪問性,提供 4 位元量化、Ollama 支援和免費的 OpenRouter 存取;@ollama 則擴大了對開源本地部署的支援。
重心持續從「模型」轉向「模型 + 協作框架 + 記憶體 + 軟體配置管理 (SCM)」:@_xjdr 發表了一篇詳細論述,指出傳統的 git/GitHub 工作流程在數十到數百個同時運行的程式碼代理 (code agents) 下會崩潰,問題包括過時的工作樹、分歧的審查狀態、環境設定開銷以及糟糕的狀態同步。
他提出的替代方案結合了虛擬淺層檢出、jj、類似 Sapling 的提交堆疊、雲端同步、檔案級 ACLs,以及從模型到 SCM 再到遠端運行時的垂直整合,目前已透過 Noumena Code / ncode 產品化,之後將免費提供其推論引擎和模型存取。
同樣地,@gneubig 認為基準測試應評估協作框架與 LLM 的組合,而非單獨評估其中之一;他的 OpenHands 比較發現,根據模型家族和成本配置,會有不同的贏家。
自動化原語 (automation primitives) 變得更易於教學和重複使用:@OpenAIDevs 推出了 Codex Record & Replay,讓使用者演示一次工作流程,即可將其轉化為可檢查的技能;@cursor_ai 推出了 /automate,Cursor 能夠根據自然語言任務配置觸發器、指令和工具,並新增了 Slack 表情符號觸發器、GitHub 觸發器以及雲端代理的電腦使用功能。
@ClaudeDevs 在 Claude Code 中發布了 Artifacts,使代理能夠將正在進行的工作轉化為可共享的即時頁面;@_catwu 表示這已經改變了內部用於架構變更和原型共享的工作流程。
安全和審查正成為代理的首要任務:@cognition 在 Devin Review 中新增了自動安全審查功能,而 @shayanshafii 則將 Devin for Security 視為解決應用程式安全 (AppSec) 中長期存在的「發現與修復」分歧,透過代理推理加上協作框架,將較低嚴重性的發現串聯成已確認的嚴重漏洞。
在工具領域,參與度最高的推文是 @OpenAIDevs 的 Codex Record & Replay,這反映了對基於演示的代理工作流程自動化有著強烈的需求。
Artificial Analysis 推出了一個更真實的代理式知識工作基準測試:@ArtificialAnlys 推出了 AA-Briefcase,該測試圍繞多週專案、數千個零碎輸入、Slack/電子郵件/文件語料庫,以及財務模型和董事會簡報等交付物而建構。
在此基準測試中,Claude Fable 5 以 1587 Elo 領先,其次是 Opus 4.8 的 1356,而 GLM-5.2 以 1266 成為最強的非 Anthropic 開源(或類開源)參賽者。重要的是,該基準測試同時揭示了品質和經濟效益:Fable 5 平均每項任務花費 31 美元,Opus 4.8 為 10.40 美元,GPT-5.5 xhigh 為 3.68 美元,GLM-5.2 為 2.40 美元,而一些較弱的選項則便宜數個數量級。
更廣泛的教訓不僅是排行榜的變動,而是現實世界中長週期知識工作仍然困難:頂級模型僅在 3% 的任務中滿足了所有評分標準。
其他基準測試工作也朝著相同的方向推進:@terminalbench 發布了 Terminal-Bench Challenges,用於長週期、高 token 消耗的單一任務;@omarsar0 強調了 SkillWeaver,它將代理路由視為組合式技能檢索 + DAG 規劃,而非單一工具選擇;@arena 描述了 Agent Arena 的因果追蹤方法,透過可控性、bash 恢復和工具幻覺等信號,量化人機協作的價值。
@isidoremiller 也持續對代理評估品質提出元批評,他認為目前的分析代理基準測試常常測量錯誤的內容。
推論和檢索優化仍然是一個重要的次要主題:@liquidai 發布了 LFM2.5-Embedding-350M 和 LFM2.5-ColBERT-350M,這些多語言檢索模型涵蓋 11 種語言,聲稱在其企業堆疊上實現 1.5 毫秒的端到端檢索延遲。
@CoreWeave 聲稱 Kimi K2.7 Code 的服務速度達到 289 tok/s,強調供應商端的性價比作為差異化因素。@vllm_project 報告了 Ray Serve LLM + vLLM 的改進,透過直接串流、Ray V2 執行器後端和基於 HAProxy 的入口路由,在預填充密集型工作負載上吞吐量提高了 4.4 倍,在解碼密集型工作負載上提高了 24 倍。
向量資料庫 (Vector DB) / 解析的經濟效益顯著改善:@turbopuffer 將其基本方案從每月 64 美元降至 16 美元,然後新增了 i8 向量,使每維位元組數降低 4 倍,並在與量化感知嵌入搭配使用時,儲存/查詢成本降低高達 75%。
在文件處理方面,@llama_index 和 @jerryjliu0 發布了 LiteParse v2.1,聲稱這是最快的開源、無模型 PDF/文件轉 Markdown 管線,在三個基準測試中超越了多個開源解析器基準。
OpenAI 在健康領域有顯著的進展:@OpenAI 分享了一項與波士頓兒童醫院/哈佛大學合作的 NEJM AI 研究,顯示 o3 Deep Research 幫助臨床醫生重新審視了先前未解決的兒科罕見疾病案例;@gdb 總結這項研究,指出它幫助在 376 個先前未解決的案例中找到了 18 個新診斷。
另外,@OpenAI 表示 GPT-5.5 Instant 現在在健康相關問題上已與前沿的「思考型」模型不相上下,這得到了來自 60 個國家、49 種語言和 26 個專業的數百名醫師的回饋支持。
OpenAI 也發表了更廣泛的對齊研究:@OpenAI 介紹了關於訓練模型使其廣泛且持續有益的研究,聲稱在健康領域對話中,透過強化學習 (RL) 強化真實性、謙遜和對人類福祉的關注等特質,改善了 53 項內部/外部對齊和效益評估中的 44 項。
根據 @thekaransinghal 的說法,即使是僅針對健康領域的有益特質訓練,也改善了 19 項非健康領域對齊評估中的 17 項,包括欺騙和程式碼獎勵駭客行為。這項研究尚處於早期階段,但它是將「廣義有益行為」而非狹隘的拒絕式安全操作化的更明確嘗試之一。
參與度最高的推文 (依互動數):
@narendramodi 會見 Mistral 的 Arthur Mensch:主要涉及地緣政治而非技術,但作為國家級 AI 外交和印度夥伴關係定位的另一個信號,值得關注。
@OpenAIDevs 關於 Codex Record & Replay:當天最受關注的開發者工具貼文;強烈驗證了基於演示的自動化作為產品介面的價值。
@ClaudeDevs 關於企業託管驗證 (Enterprise-Managed Auth) for MCP:高度參與的企業基礎設施公告;透過 IdP 實現 MCP 連接器的中央驗證,對於企業代理部署是重要的基礎設施。
@OpenAI 關於 GPT-5.5 Instant 健康改善:最強烈的信號之一,表明主流產品模型正圍繞特定領域的實用性進行調整,並採用醫師主導的評估循環。
@jeremyphoward 關於 GLM-5.2 和 @ollama 關於擴展 GLM-5.2 雲端容量:兩者共同捕捉了當天開源模型的情緒,GLM-5.2 不僅僅是發布了;它立即受到了壓力測試、讚揚和實際應用。
GLM-5.2 是本地 AI 的勝利 (活動:1623):這篇貼文認為,儘管 GLM-5.2 擁有 753B 總參數的 MoE 架構(約 40B 活躍/token),但它對本地 AI 仍意義重大,因為其 MIT 許可證、28.5T token 的預訓練規模、聲稱支援 1M 上下文 / 131k 輸出,以及前沿級別的程式碼代理行為,可能促成高品質的合成數據蒸餾到 8B/70B 的本地模型中。
作者估計推論記憶體從 FP8 的約 744–890GB,動態 1 位元量化後可降至約 176–180GB,而 KV 快取開銷大約為每 10 萬 token,FP16/BF16 為 15–20GB,8 位元為 7.5–10GB,4 位元快取為 3.5–5GB,同時指出該表格由 AI 生成且為近似值。
評論者報告了強烈的 API 使用印象,其中一人聲稱 GLM-5.2 和 MiniMax/Mimi 模型已大致縮小了與專有前沿模型的差距,並且他們會信任 GLM-5.2 勝過 Opus 4.8。其他人則對「本地」實用性提出質疑:一些擁有 512GB Mac、GB10 叢集或多個 128GB AMD AI Max 系統的使用者或許可以運行它,但硬體要求越來越「難以獲得」,這激發了人們對蒸餾或密集型 70B 變體的興趣。
幾位評論者認為 GLM-5.2 縮小了大型開源權重/API 可存取模型與前沿閉源模型之間的差距,其中一位使用者表示,與 MiniMax M3 / Mimi-V2.5-Pro 一起,「前沿模型與大型開源模型之間的距離已大致縮小」。


