隨著基礎模型公司將代理(agentic)能力視為基本要求,Anthropic 發表了 Claude Sonnet 5,這是該實驗室中型模型中更強大且具備代理功能的版本。
Anthropic 在一篇部落格文章中表示:「它能夠制定計畫、使用瀏覽器和終端機等工具,並以過去僅需更大、更昂貴模型才能達到的水準自主運行。」
這種說法與 OpenAI 和 Google 最近發布的產品不謀而合。OpenAI 的 GPT-5.6 Sol 上週推出預覽版,也是該公司迄今最具代理能力的模型,允許使用者將工作分配給多個子代理以執行更長的自主任務。Google 在五月推出的 Gemini 3.5 Flash,則被定位為從對話式聊天機器人轉變為代理工具,能夠以最少的人工輸入來規劃、建構和迭代實際工作。
Sonnet 5 的推出證實了代理能力已成為各價格區間的最新基準期望。現在的差異化不再是誰能最好地完成代理工作,而是誰能以更低的成本、更可靠地在沒有人為監督下完成。
Sonnet 5 承諾提供接近 Opus 4.8 的性能,但成本顯著降低。從週二開始,Claude Sonnet 5 將成為免費和 Pro 方案的預設模型,並適用於所有訂閱方案。
推出時,Sonnet 5 的定價為每百萬輸入 token 2 美元,每百萬輸出 token 10 美元,此價格將持續到 8 月 31 日,之後輸入 token 的價格將上漲至每百萬 3 美元,輸出 token 仍為每百萬 10 美元。這使得 Sonnet 5 比 Opus 4.8、OpenAI 的 GPT-5.5 和 Google 的 Gemini 3.1 Pro 更便宜(但仍比 Gemini 3.5 Flash 貴)。
根據 Anthropic 的說法,這款新模型在代理性能方面,例如推理、工具使用、軟體編碼和知識工作,也比其於二月發布的前身 Sonnet 4.6 有顯著改進。
例如,在一個代理編碼基準測試中,Sonnet 5 獲得 63.2% 的分數,而 Opus 4.8 為 69.2%,Sonnet 4.6 為 58.1%。在知識工作基準測試中,Sonnet 5 甚至略微超越了 Opus 4.8,後者以解決最困難問題(如做出細微判斷和深入研究)而聞名。
Anthropic 表示:「Opus 4.8 仍然是這些任務中追求更高準確度的首選模型,但 Sonnet 5 為開發者提供了價格更低、品質遠高於以往的選項。」「在 Sonnet 5 和 Opus 4.8 之間,使用者可以調整投入程度,以找到成本和性能之間的最佳平衡。」
根據部落格文章中引用的測試者說法,Sonnet 5 還擅長完成複雜任務,而舊版模型可能會中途停止,並且「無需明確要求即可檢查自己的輸出」。
Zapier 的資深工程師 Daniel Shepard 在一份聲明中表示:「我們給 Claude Sonnet 5 一項兩部分的工作,更新 Salesforce 帳戶層級,並向企業聯絡人發送發布公告,它從頭到尾都完成了。」「以前這項任務會中途停滯。對於日常自動化來說,這是一個不費吹灰之力的選擇。」
在安全性方面,Sonnet 5 也展現出比其前身更低的「不良行為」發生率,例如與濫用和欺騙的合作,使其在代理情境中更安全。它更擅長拒絕惡意請求,並在提示詞注入攻擊中避免劫持嘗試。它也比 Sonnet 4.6 更少出現幻覺和奉承行為。
儘管如此,在處理不當行為方面,它仍未達到 Opus 4.8 和 Claude Mythos Preview 的水準。部落格文章寫道:「評估也顯示,它執行危險網路安全任務的能力遠低於我們目前的 Opus 模型。」
Lovable 共同創辦人 Fabian Hedin 在一份聲明中表示,Claude Sonnet 5「乾淨且一致地拒絕不安全的請求」。
Hedin 說:「在 Lovable,我們將強大的工具交到數百萬開發者手中。」「一個知道何時說不的模型,與一個知道如何建構的模型同樣重要。」



