在 GPT-5.6 Sol Ultra 即將發布之際,人們正競相探索 Fable 5 的極限,因為訂閱補貼即將結束。Thariq 原本正在撰寫「Fable 實地指南」部落格系列,恰好在 Fable 5 重新發布當天安排了一場主題演講,因此他連夜調整了演講內容,提供了最及時的建議,並於今日發布。

這場演講分為四個部分。首先是 Fable 的介紹與背景設定,接著是「解綁 Claude:理解模型行為」。模型所受的限制往往是我們施加的,「我們為它們戴上的韁繩,以及我們提示它們的方式」。因此,當我們遇到一類新的模型時,應該預期移除或改變這些韁繩和提示詞,以激發出你原本永遠不會看到的行為,因為你過度限制(或稱「綁住」)了模型。

一個典型的例子是,大多數人都同意 Thariq 關於 HTML 不合理有效性的觀點。

第三部分是「找到你的未知:導航地圖與實際情況之間的鴻溝」,這與「解綁」密切相關。如果說「解綁」是關於清除過時的已知,那麼這就是關於找到你甚至不知道自己不知道的事物。最簡單的技巧包括:讓 Claude 進行「盲點檢查」以找出你的未知、為「截然不同的設計方向」進行腦力激盪、透過訪談來優先處理高影響力的問題、使用參考資料(例如在遷移案例中)、維護 implementation-notes.md 運行日誌來記錄為你做出的未明確決策,以及透過測驗來確保你對模型的理解。

第四部分是「處理悲傷:反思程式設計生產力的情感轉變」,因為過去需要數週才能完成的工作現在只需數小時。最後是「不合理:要求又好、又快、又便宜的結果」,這意味著「權衡並非真實存在」。因為 Fable 更具能力,你可以更具野心,不再接受權衡。「建構很容易,但創造價值仍然很難。」總體而言,這是一場精彩的演講,隨著世界適應首批 Fable 級模型,我們將會進一步探討其影響。

AI 新聞(2026 年 7 月 4 日至 7 月 6 日)

騰訊混元 Hy3 發布與開源前沿

Hy3 作為一個嚴謹的開源模型問世:騰訊在 Apache 2.0 許可下發布了 Hy3,這是一個 295B 的專家混合模型(MoE),擁有 21B 的活躍參數,192 個專家 / top-8 路由,分組查詢注意力(GQA),256K 的上下文長度,以及一個用於推測解碼的 3.8B MTP 層。

多個貼文認為它在推理、編碼和代理任務上與更大的系統具有競爭力,特別強調了工具呼叫穩定性和反幻覺等可靠性改進。

推論支援在發布當天就異常成熟:vLLM 專案表示 Hy3 從發布起就原生支援 vLLM,具備工具呼叫和推理解析器、MTP 推測解碼,並在 NVIDIA 和 AMD 上驗證支援。後續的詳細說明指出,騰訊的生產核心現在已上游到 vLLM 主線,包括負載平衡解碼排程和融合 FP8 MoE 服務,據報導在混合長度解碼上性能提升高達 2.95 倍,與預設後端相比,首次生成時間(TTFT)延遲減少約 24%,每輸出詞元時間(TPOT)減少約 17%。

社群反應強烈,Teknium 迅速將 Hy3 在 Nous Portal 上免費提供兩週。

更廣泛的開源模型背景:Hy3 立即與 GLM-5.2 進行比較,一些發文者認為,如果基準測試和實際體驗結果成立,騰訊已加入開源實驗室的頂級行列,而另一些人則認為 GLM-5.2 仍然是目前實踐中最好用的開源模型。總體而言,開源前沿正在迅速壓縮,競爭日益集中於部署的穩健性,而不僅僅是原始排行榜上的分數差異。

代理基準測試、應用框架與長期記憶

AutomationBench-AA 增加了更真實的代理評估:Artificial Analysis 啟動了 Zapier AutomationBench 的獨立排行榜,評估代理在 657 個任務和 40 個模擬 SaaS 應用中的表現,同時考慮目標和防護措施。

Claude Fable 5 以 48.6% 的分數領先,略高於 Opus 4.8 的 48.5%,Gemini 3.5 Flash 為 42.6%,GPT-5.5 xhigh 為 42.1%。比排名更有趣的是:每個模型仍然會違反業務規則,而 Gemini 在「每違反防護措施的目標達成率」和成本效率方面表現出色。

開源模型仍然明顯落後,GLM-5.2 max 是列表中表現最好的開源模型,得分為 27.8%。

能力指標正變得多維度:Artificial Analysis 還引入了六個領域特定指標,金融與會計、法律、醫療保健與醫學、策略與營運、工程、經濟學,以超越單一的標量模型分數。頭條新聞很熟悉,Claude Fable 5 加上 Opus 4.8 備用模型領先,但更有用的見解是排名如何根據領域急劇重新洗牌,以及性價比前沿變得多麼陡峭。

這與 François Chollet 的觀點一致,他認為在沒有每任務成本的情況下報告基準分數越來越沒有意義。

記憶和檢索仍然是持久型代理的瓶頸:兩篇論文在此獲得關注。首先,A-TMA 解決了「幽靈記憶」問題,即在長期運行的助理中,過時和當前的事實會一起被檢索;在 LTP 基準測試中,將其添加到 Graphiti 據報導可將衝突準確性絕對提高 0.240。

其次,ReContext 是一種無需訓練的長上下文推論框架,它在答案生成之前重播模型內部證據,提高了八個 128K 資料集上的證據利用率。結合用於百萬詞元上下文內檢索的 BlockSearch,主題很明確:更好的記憶行為正日益在推論時進行工程設計,而不僅僅是透過訓練實現。

Anthropic 的 J-Space / 全局工作空間研究成果

機械可解釋性成為焦點:Anthropic 發布研究,聲稱 Claude 內部存在類似全局工作空間的結構,其核心是一小部分被稱為 J-space 的激活。核心主張不是鏈式思考的提取,而是識別出一個特權的內部表徵基質,它似乎可用於報告、調變和靈活推理。Anthropic 還為開源模型發布了 Neuronpedia 演示。

研究人員為何關注:可解釋性研究人員將此視為模型「工作記憶」或內部工作空間比以往公開工作更強的證據,即使他們不同意其框架。Neel Nanda 稱其為迄今為止工作記憶機制最好的證據。Jack W. Lindsey 認為理解這個特權空間可能是 LLM 認知關鍵。貼文還強調了實際的安全角度:據報導,該工作空間可以揭示隱藏概念、檢測提示詞注入,並在概念被表達之前暴露內部與破壞相關的功能。

但「意識」的說法受到質疑:Anthropic 的公開框架引發了強烈反彈。支持者表示,這些結果表明的是功能上的「存取意識」類比,而非「現象意識」,而批評者則認為該公司過度宣稱,將特權潛在激活與意識混為一談。即使是一些持同情態度的觀點也強調,更大的故事是為審計和引導模型提供了一個新的干預點,而非哲學問題。

推論、服務與系統效率

推測解碼仍然是熱門基礎設施:LMSys 組織將 DSpark 添加到 SGLang 中,用於信心驅動、可變長度的驗證。其優勢在於,在高負載下,它避免驗證每個草稿詞元,相對於固定預算的推測方法,改善了吞吐量/延遲的權衡;據報導,DeepSeek-V4-Pro 在 B300 上以批次大小 1 達到了 383.7 詞元/秒。

微軟還討論了在 GitHub Copilot 框架中對 GPT-5.5 進行提示詞級別優化,以在發布後改善延遲和詞元效率。

推論效率日益成為戰略瓶頸:Jon Durbin 認為,推論而非單獨的訓練,現在是「整個遊戲」,因為每個資料管線、強化學習迴圈和代理執行時最終都體現為測試時的計算。這一觀點也體現在底層核心工作上:Chutes 報導了 MiniMax MSA 和 GatedDeltaNet-2 的顯著加速,包括在 RTX Pro 6000 / SM120 上稀疏注意力訓練提高了約 7 倍,以及更好的融合 FP8 核心。

模型服務之外的基礎設施發布:Cloudflare 推出了 Workers Cache,這是一個透過標準 HTTP 標頭配置的區域分層快取,位於 Worker 入口點之前。OpenAI 發布了 GPT-Realtime-2.1-mini,將推理和工具使用帶入迷你即時產品線,價格與之前的迷你版相同,同時聲稱透過快取改進,p95 延遲減少了 25% 以上。

世界模型、語音與文件 AI

MIRA 是一個值得注意的世界模型演示:General Intuition 和 Kyutai 與 Epic Games 合作,推出了 MIRA,這是一個可玩的 Rocket League 多人世界模型,透過 1 萬小時的機器人收集資料進行訓練。

它以 20 幀/秒的速度即時運行,貼文強調一個 5B 參數的模型可以在單個 NVIDIA B200 上運行整個 2v2 比賽,沒有明確的物理或渲染引擎。這是視訊/世界模型工作從玩具演示轉向互動式模擬器最清晰的信號之一。

語音領域競爭依然激烈:AssemblyAI 發布了 Universal-3.5 Pro Realtime,這是一個串流語音轉文字(STT)模型,在 AA-WER Streaming 上錯誤率為 4.1%,並具有可在通話中更新而無需重新連接的情境啟動功能。

在文字轉語音(TTS)方面,Artificial Analysis 表示 Speechify Simba 3.2 現在以 1233 Elo 分數領先其 Speech Arena,超越 Gemini 3.1 Flash TTS、Sonic 3.5 和 Inworld Realtime TTS 1.5 Max,同時也是排名靠前模型中最便宜的。

文件上下文管線預設為多模態:LlamaIndex 和 LanceDB 描述了一個用於處理雜亂 PDF 的檢索管線,該管線將頁面、區塊和提取的資產分離到連結的多模態表格中,據報導在標記的 ESG 報告基準測試中,任何頁面命中率@5 達到 82%,答案準確度達到 74%。這與 Jerry Liu 關於為代理專門設立「文件上下文層」的廣泛論點相輔相成。

熱門推文(按互動量)

Anthropic 的全局工作空間論文在互動量上佔據主導地位,關於 Claude 內部工作空間/J-space 的主要公告遠超其他所有內容。騰訊 Hy3 是最大的純模型發布新聞,特別是在討論開源競爭力和部署的技術帳戶中。MIRA 的可玩世界模型是突出的多模態/系統演示。

Will Depue 的「資料星際之門」討論串是最具實質性的策略貼文,認為資料收集,而非單獨的計算,成為前沿實驗室的約束條件和潛在護城河。John Carmack 的記憶系統討論串引起了顯著的技術興趣,他認為推論硬體可以利用確定性存取模式和比高頻寬記憶體(HBM)便宜得多的記憶體層級來服務大型模型。

LongCat 2.0(1.6T,約 48B 活躍參數)權重現已在 MIT 許可下開源。