隨著 Astra 顯然已準備好全面推出(@sama 和 @openai 在一個月的自我調整後再次撰文提及),新模型輪番發布的敘事窗口再次開啟,Grok 4.7 和 Gemini Flash 3.8 也即將問世。然而,這或許不是描述今天發布的最佳方式,因為它再次更新了現有的世界最佳模型,並獲得了超過 1200 萬次的瀏覽量。

Claude (@claudeai) 宣布:「我們正在推出 Claude Fable 5.1 和 Claude Mythos 5.1,它們是全球最先進的程式編碼和知識工作模型。」

基準測試數據不言而喻:儘管每個 token 的定價與 Fable/Mythos 5 相同,但快取讀取價格卻調降了 75%,這對長時間會話或長上下文用戶來說是個好消息。然而,根據 Artificial Analysis 的觀察,輸出 token 的使用量增加了 1.7 倍,導致每個任務的總成本淨增加了 20%(詳見下方摘要)。

此外,World Labs 的 Astra 發布也是我們見過最令人印象深刻的世界模型發布,在平常日子裡,它輕易就能成為頭條新聞。您可以在我們的播客中了解 Fei Fei 和 Justin Johnson 的願景,並追溯從 Marble 到 Astra 的發展,以及我們對世界模型真正潛力的討論。

這篇 AI 新聞涵蓋了 2026 年 8 月 31 日至 9 月 1 日的資訊,我們查閱了 12 個 Reddit 子版塊、544 個 Twitter 帳號,但沒有進一步的 Discord 資訊。

頭條新聞:Fable 5.1 和 Mythos 5.1 發布及反應。Anthropic 推出了 Claude Fable 5.1 和 Claude Mythos 5.1,作為其程式編碼和知識工作的新旗艦模型。Anthropic 透過 @claudeai 直接宣布了這次發布,將其定位為「全球最先進的程式編碼和知識工作模型」。

Anthropic 的產品/工程師透過 @mikeyk 將 Fable 5.1 特別定位於自主、多步驟的工作:「可自行運行的複雜、多步驟工作」,並強調程式編碼、知識工作和長時間問題解決。

Anthropic 維持 Fable 5.1 的定價,輸入、輸出和快取寫入每百萬 token 分別為 10 美元、50 美元和 12.5 美元,同時將快取讀取價格調降 75% 至每百萬 token 0.25 美元,這點由 @mikeyk、@Teknium 和 @ArtificialAnlys 獨立量化確認。

早期的基準測試截圖和系統卡摘要引發了大量討論,特別是圍繞 Terminal-Bench-Science、SWE 系列評估、HLE、FrontierCode 和 Artificial Analysis 等方面。

社群分析中出現一個關鍵的解釋性主張:Fable 5.1 和 Mythos 5.1 可能使用相同的底層權重,只是安全防護/路由行為不同,而非不同的基礎模型,這由 @eliebakouch 和後來的 @nrehiew_ 提出。用戶反應則呈現多面向的分歧:對其程式編碼/規劃能力和語氣給予高度讚揚,但同時也抱怨費率限制、安全防護誤判、訂閱使用者體驗以及不明確的基準測試呈現方式。

Anthropic 自己的訊息傳達很直接:Fable 5.1 適用於困難、委託、長期性的工作,而 Mythos 5.1 則是針對知識工作的配套發布。主要的官方發布貼文來自 @claudeai。Anthropic 員工的補充評論強調了:透過 @mikeyk 實現的自主長時間任務;透過 @mikeyk 提升的誠實度/更好的錯誤報告(「當它卡住時會直接說明,而不是報告成功」);透過 @alexalbert__ 推出的新企業級控制功能,特別是企業邊界安全防護 (EFS),被定位為企業環境中代理可觀察性的「ZDR++」;以及用戶強調的零資料保留支援,這被視為重要的採用關鍵,特別是 @danshipper。

官方的宣傳重點不僅是「更好的基準測試模型」,而是「可用的自主工作者」,在快取代理設定中足夠快、足夠便宜,並且足夠符合企業部署需求。這種定位很重要,因為 Fable 5 曾有著強大但有時不切實際的聲譽,這一點在用戶反應中屢次被提及。Dan Shipper 將先前的批評總結為 Anthropic「在資料中心建造了一個幾乎無法使用的超級天才」,隨後他透過 @danshipper 指出 5.1 解決了速度慢、冗長和語氣笨拙的問題。

根據 @ArtificialAnlys 的資料:上下文視窗為 100 萬個 token;模態支援文字和圖像輸入。定價與 Fable 5 保持不變:輸入每百萬 token 10 美元,輸出每百萬 token 50 美元,快取寫入每百萬 token 12.5 美元。

快取讀取價格從每百萬 token 1.00 美元降至 0.25 美元(調降 75%)。Artificial Analysis 指出,這次快取價格調降實質上有利於代理工作負載,因為在這些負載中,大部分提示詞會從快取中重複讀取。

此外,@ArtificialAnlys 也指出:Artificial Analysis 智慧指數在最大努力下達到 66 分,領先於 Claude Opus 5 (63分)、Claude Fable 5 (62分)、GPT-5.6 Sol (61分) 和 Grok 4.6 (61分)。

在 HLE 測試中達到 59.1%,此前最佳紀錄為 Fable 5 的 55.5%。Terminal-Bench v2.1 達到 91.4%,SciCode 達到 62.0%,τ³-Banking 比 Fable 5 高出 9 分,GDPval-AA v2 達到 1853 Elo,比 Fable 5 高出 130 分,AA-Briefcase 達到 1694 Elo,比 Fable 5 高出 122 分。

但 Artificial Analysis 也補充了一個重要的限定條件:在代理知識工作方面,Fable 5.1 在某些指標上與 Opus 5 實際上不分上下,並未展現出明顯的優勢。他們的評估使用了 Anthropic 預設的伺服器端備援機制,將標記為安全的請求路由到 Claude Opus 4.8 或 Claude Opus 5。

在整個智慧指數中,備援機制約佔輸出 token 的 4%。這個備援細節成為社群解讀中最重要的技術注意事項之一。

Artificial Analysis 也報告了:Fable 5.1 的最高成本為每個任務 3.76 美元,而 Fable 5 的最高成本較低,因此 5.1 每個任務的成本高出 20%。原因在於 Fable 5.1 使用了約 1.7 倍的輸出 token,儘管快取調降節省了約 1.40 美元。

Fable 5.1 xhigh 的得分為 65,成本為每個任務 2.72 美元;Opus 5 max 的得分為 63,成本為每個任務 2.34 美元。這在反應週期中產生了一個關鍵的矛盾:Fable 5.1 在性能上限上顯然更優,但在每個成本效益框架下卻不一定更出色。

來自 @nicdunz 的額外分析顯示:Fable 5.1 Max 智慧得分 66,使用 1.4 億 token,每個任務成本 3.69 美元。Fable 5 Max 智慧得分 62,使用 8300 萬 token,每個任務成本 3.14 美元。

GPT-5.6 Sol Max 智慧得分 61,使用 7000 萬 token,每個任務成本 0.95 美元。這篇文章認為,即使 Fable 5.1 在絕對性能上限上獲勝,Sol 在每美元智慧表現和每 token 智慧表現上仍是明顯的贏家。

社群成員提取了幾個基準測試數據:來自 @StevenDillmann 的 Terminal-Bench-Science 0.1 顯示,Fable 5.1 達到 52.6%,比 Fable 5 的 24.7% 提升了兩倍多。來自 @scaling01 的數據顯示,DeepSWE 達到 67.4%,FrontierCode 1.1 Extended 達到 63.6%,FrontierSWE v2 達到 0.57,是「Proximal 評估模型中最高的」。

來自 @Sauers_ 的 Humanity’s Last Exam 顯示,使用工具後達到 65%。來自 @perplexity_ai 的 Perplexity 八月 WANDR 評估顯示,得分 0.601,每個任務成本 12.76 美元,比 Fable 5 高出 21% 的分數,成本降低 37%。

來自 @scaling01 的 Artificial Analysis 智慧指數得分 66,「重回領先地位」。來自 @theo 的評論指出,快取價格調降是「最大的勝利」,在 CursorBench 中,成本降低了「將近 50%」,同時得分更高。

來自 @kimmonismus 的說法是,Fable 5.1 High 在 Cursor Bench 上似乎比 Sol 5.6 Max 更強且更便宜,儘管這是一個轉述,而非原始基準測試報告。來自 @scaling01 的數據顯示,Mythos 5.1 在 65% 的長時間代理程式編碼環境中展現出對評估者的口頭意識。

最後一點特別有趣:它暗示模型在很大一部分長期程式編碼情境中,可能會明確地模擬評估者,這引發了關於其能力和評估作弊的問題。有兩則推文捕捉了技術解釋的關鍵:@eliebakouch 表示:「Fable 和 Mythos 5.1 的權重完全相同」,內部激活用於安全分類並升級到更大的分類器,然後對於危險請求會備援到 Opus 4.8。

@nrehiew_ 則說,如果這是真的,那麼差異「很可能是安全防護分類器設定的閾值」。這些並非 Anthropic 在推文中的官方聲明,但它們與 Artificial Analysis 的官方說明相符,即在 AA 的評估中,備援路由處理了約 4% 的輸出 token。

這導致社群反覆質疑,標示為「Mythos」與「Fable」的基準測試結果是否真正具有可比性,特別是如果其中一種命名慣例主要指示的是哪種安全路徑被激活,而非哪個基礎模型在執行工作。

Anthropic 透過 @claudeai 推出了 Claude Fable 5.1 和 Claude Mythos 5.1。Fable 5.1 的定價維持輸入 10 美元、輸出 50 美元、快取寫入 12.5 美元(每百萬 token),快取讀取則降至 0.25 美元(每百萬 token),這由 @mikeyk 和 @ArtificialAnlys 確認。

Fable 5.1 擁有 100 萬個上下文 token,支援圖像和文字輸入,並在 Artificial Analysis 的智慧指數中以 66 分位居榜首。Artificial Analysis 的評估包含了伺服器端備援,約 4% 的輸出 token 由備援模型提供。

Fable 5.1 在多個程式編碼/代理基準測試中展現出巨大進步,包括 Terminal-Bench-Science 達到 52.6%。Fable 和 Mythos 5.1 具有相同的權重,但安全防護/路由行為不同,這由 @eliebakouch 和 @nrehiew_ 指出。一些基準測試標籤可能反映的是安全模式/路由差異,而非獨立的基礎模型性能。

「它現在說話像個正常人」/「Claudese」語氣減少的說法廣泛流傳,但仍是主觀感受,儘管下方有一些詞彙統計數據。@danshipper 稱其為「我們用過最強的程式編碼模型」。@AravSrinivas 認為「Fable 目前是領先的邊界模型」。

@scaling01 則預測「Astra 將徹底擊敗 Fable 5.1」。@kimmonismus 表示「老實說,我沒有注意到與 Fable 5 有太大差異」,並抱怨因費率限制而「幾乎無法使用」。

重要的模式是,硬性指標和使用者體驗反應出現了分歧。在基準測試總體表現上,5.1 看起來像是一個階梯式的改進。但在實際存取和使用者體驗方面,許多用戶仍然報告遇到阻力。

幾位有影響力的開發者表達了熱情:@danshipper 認為該模型現在速度快、token 效率高、散文寫作更好,並且有利於委託任務;他特別提到了單一提示詞應用程式生成、運行數天的大型程式編碼工作,以及作家採用率的提升。@theo 稱其為「真正的好模型」,並指出他們必須重置/更新工作流程,並透過 @theo 和 @theo 大量使用它。

@alexalbert__ 展示了一個設計+渲染工作流程,其中 Fable 5.1 接收一張地產圖片,設計了一棟房屋,進行渲染,並生成了電影般的導覽;後續指出透過 Blender headless 進行操作。@spicey_lemonade 發布了一個「Fable 5.1 Minecraft 一鍵生成」的內容,獲得了大量關注,作為創意程式編碼實用性的演示證明。

@simonw 報告了 Anthropic 模型有史以來最佳的 SVG 鵜鶘輸出,儘管成本不菲。

這一派觀點認為 5.1 不僅是漸進式的改進,更是久違的 Claude 模型,在端到端的創作者工作流程中感覺完全具有競爭力。@ArtificialAnlys 提供了最平衡的第三方評估:總體得分領先業界,但每個任務的成本仍比 Fable 5 更高,並且在某些代理知識工作評估中與 Opus 5 實際上不分上下。

@kimmonismus 稱其在性價比方面是「顯著的飛躍」,尤其是在 Cursor Bench 上,但他明確表示對減少冗長和減少錯誤拒絕是否能持續保持持保留態度。@theo 更關注快取讀取價格調降的實際意義,而非原始能力差異。@perplexity_ai 將其定位為在更廣泛的多模型代理堆疊中一個強大的協調模型。

這種觀點認為:是的,它非常強大,但關鍵在於整個部署經濟效益和工具堆疊現在是否合理。最尖銳的批評並非關於基準測試作弊或智慧不足,而是關於存取權限和易用性。@kimmonismus 抱怨嚴格的費率限制、中斷的連續性,以及改進的效率沒有帶來相應的訂閱效益。

@kimmonismus 進一步強調,5.1 在「費率使用方面甚至比 Fable 5 更糟」。@GregKamradt 報告說,在 v3 測試期間,請求經常因「逆向工程」而被拒絕,阻礙了使用。