更新,2026 年 7 月 1 日:Anthropic 發送了修正後的 BrowseComp 基準測試數據。更新後的數據顯示,Sonnet 5 的表現大致與 Opus 4.8 持平,且與其前身 Sonnet 4.6 之間的差距甚至比最初顯示的更大。目前尚不清楚如果它需要消耗更多代幣才能完成任務,是否真的更划算。
原始文章,2026 年 6 月 30 日:Anthropic 發布了 Claude Sonnet 5。在基準測試中,它逼近了更大的 Opus 4.8 模型,甚至在某些領域超越了它。該模型現已以優惠價格推出。
Anthropic 稱其為迄今為止最具代理能力的 Sonnet 模型:它能夠制定計畫、使用瀏覽器和終端機等工具,並以幾個月前只有更大、更昂貴的模型才能達到的水準自主工作。Sonnet 5 的目標就是縮小這個差距。
基準測試顯示,Sonnet 5 相較於 Sonnet 4.6 有了明顯的飛躍。Anthropic 公布的基準測試顯示,Sonnet 5 在所有測試類別中都超越了其前身 Sonnet 4.6,同時也追趕上了更昂貴的 Opus 4.8。
在代理編碼方面,Sonnet 5 在 SWE-bench Pro 上達到 63.2%,高於 Sonnet 4.6 的 58.1%,而 Opus 4.8 則為 69.2%。在 Terminal-Bench 2.1 上,Sonnet 5 獲得 80.4%,而 Sonnet 4.6 為 67.0%。
對於多學科推理(Humanity's Last Exam),該模型在工具輔助下達到 57.4%,幾乎與 Opus 4.8 的 57.9% 持平。在電腦使用方面(OSWorld-Verified),Sonnet 5 達到 81.2%,而其前身為 78.5%。
在知識工作基準測試 GDPval-AA v2 上,Sonnet 5 甚至以 1,618 分擊敗了更大的 Opus 4.8 的 1,615 分,該測試評估 AI 在現實世界知識任務中的表現。Anthropic 表示,早期合作夥伴的回饋也證實了這一點。Sonnet 5 的代理能力遠超之前的版本,這體現在它處理搜尋任務的方式上(請參閱上方更新的基準測試)。
這次網路安全不再是問題。最近,Anthropic 因其無法發布的模型而成為新聞焦點。美國政府因網路安全問題阻止了該公司兩個最強大的模型 Mythos 5 和 Fable 5。這個背景籠罩著 Sonnet 5 的發布。Anthropic 顯然急於消除任何類似的擔憂。
該公司表示,該模型並未接受網路安全任務的訓練,在測試諸如編寫軟體漏洞利用等高風險能力時,它的得分遠低於 Opus 4.8 和 Mythos 5。在 Firefox 147 漏洞利用評估中,Sonnet 5 像其前身 Sonnet 4.6 一樣,無法開發出完全可運作的漏洞利用,但部分控制率略高,達到 13.2%。Mythos 5 和 Opus 4.8 在這項任務上的能力遠強。
儘管如此,Sonnet 5 在這些任務上的得分確實比其前身略高。因此,Anthropic 預設啟用了網路安全防護措施。這些措施能即時標記並阻止高風險的網路使用,與 Claude Opus 4.7 和 4.8 已有的保護措施相當。與 Fable 5 的防護措施相比,它們有所放寬,因為用戶幾乎立即就對 Fable 5 的防護措施提出了抱怨。Anthropic 表示,它認為 Sonnet 5 的整體網路安全風險較低。
在安全方面,Anthropic 表示,該模型在拒絕惡意請求和抵禦提示詞注入攻擊方面比 Sonnet 4.6 表現更好。幻覺和奉承行為(即傾向於同意用戶所說的一切)也減少了。Anthropic 的完整安全評估可在 Claude Sonnet 5 系統卡中找到。
優惠定價將持續到 2026 年 8 月。Claude Sonnet 5 現已在所有方案上線。它是免費和專業用戶的新預設模型,Max、Team 和 Enterprise 訂閱者也可以使用。開發人員可以將其整合到 Claude Code 和 Claude Platform 中。
在 API 方面,它被稱為「claude-sonnet-5」。訓練截止日期是 2026 年 1 月,具有一百萬個代幣的上下文視窗。
在 2026 年 8 月 31 日之前,Anthropic 的收費標準為每百萬輸入代幣 2 美元,每百萬輸出代幣 10 美元。之後,價格將上漲到 3 美元和 15 美元,這與之前的 Sonnet 模型價格相同。
實際成本可能會有所不同:由於該模型更具代理能力,它可能在每個任務中消耗更多的代幣。因此,即使每代幣費率相同,運行 Sonnet 5 的成本最終可能高於其前身。Opus 從 4.6 升級到 4.7 時也發生了同樣的情況。



