Anthropic 在 2026 年 6 月 30 日發表 Claude Sonnet 5,定位為「迄今最具 agentic 能力的 Sonnet 模型」。對許多開發者來說,agentic AI 的起點正是 Sonnet 系列——從 3.5、3.6 到 3.7,這些模型率先展現了令人驚豔的 coding 與工具使用能力。但近期的 agentic 能力進展,主要都集中在 Opus 等級的模型上。Sonnet 5 的出現,正是為了拉近這個差距。
根據 Anthropic 官方新聞稿,Sonnet 5 的效能已接近 Opus 4.8,但價格更低——每百萬 input tokens 定價 $2,output tokens 每百萬 $10(此價格已於 8 月 10 日轉為永久定價)。相較於前代 Sonnet 4.6,它在推理、工具使用、coding 與知識工作等 agentic 關鍵面向都有顯著進步。
能力與成本:更寬廣的 cost-performance 曲線
Anthropic 在 agentic search 評測 BrowseComp 與 computer use 評測 OSWorld-Verified 上,比較了 Sonnet 5、Sonnet 4.6 與 Opus 4.8 在不同 effort level 下的表現。結果顯示,Sonnet 5(橘線)是 Sonnet 4.6(灰線)的嚴格改進,且涵蓋比 Opus 4.8(黃線)更寬廣的 cost-performance 選項。
具體來說,Sonnet 5 在中等的 effort level 下提供顯著改善的成本效率,而在較高的 effort level 下,某些任務的表現甚至可以匹配 Opus 4.8。這意味著開發者可以透過調整 effort level,在成本與效能之間找到更適合自己專案的平衡點。
早期合作夥伴的回饋也一致指出,Sonnet 5 比前代更「agentic」:它會完成複雜任務,而前代 Sonnet 往往會中途停下來;它會主動檢查自己的輸出,不需要使用者明確要求。例如,有測試者描述,Sonnet 5 在調查 bug 時,會主動寫出重現測試、實作修復,然後 stash 起來確認 bug 在沒有變更時會回來——全部在單一 pass 內完成。
安全評估:更安全,但 cyber 能力較弱
Anthropic 的部署前安全評估顯示,Sonnet 5 整體比 Sonnet 4.6 更安全:在 agentic 安全方面,它更能拒絕惡意請求,並抵抗 prompt injection 攻擊;幻覺與 sycophancy 的比率也較低。在自動化行為稽核中,Sonnet 5 的 misaligned behavior 比率低於 Sonnet 4.6,但仍高於 Opus 4.8 與 Claude Mythos Preview。
值得注意的是,Anthropic 並未刻意訓練 Sonnet 5 的網路安全任務。在評估中,它開發 Firefox 瀏覽器漏洞 exploit 的能力遠遜於 Opus 4.8 與 Mythos 5——Sonnet 5 從未成功開發出完整可運作的 exploit,僅有略高於 Sonnet 4.6 的部分成功率。因此,Anthropic 預設啟用了 cyber safeguards,與 Opus 4.7 和 4.8 相同,但比 Fable 5 的嚴格程度低。
對產品建構者的意義
對正在打造 AI 產品的團隊來說,Sonnet 5 的意義在於:它把過去需要 Opus 等級模型才能達到的 agentic 能力,帶到了更親民的價格帶。這代表你可以用更低的成本,讓 agent 執行更複雜的多步驟任務,例如軟體工程、法律研究、保險流程自動化等。
多位合作夥伴的回饋都強調了「follow-through」與「成本效率」:Sonnet 5 能完成端到端的任務,而不會卡在中途;它能在 messy 的技術脈絡中持續 coding、工具使用與除錯。對於需要 scale 的企業,這是一個實際的營運優勢。
不過,也要留意它的限制:Sonnet 5 的 cyber 能力較弱,這對安全是好事,但如果你需要模型具備進階的滲透測試能力,可能還是得考慮 Opus 等級。此外,它的 misaligned behavior 比率雖然低於前代,但仍高於 Opus 4.8,在高風險場景中仍需謹慎評估。
價格與可用性
Claude Sonnet 5 已於所有方案上線:Free 與 Pro 方案預設使用,Max、Team、Enterprise 用戶也可使用。開發者可透過 Claude API 呼叫 claude-sonnet-5。Anthropic 也提高了 Chat、Cowork、Claude Code 與 Claude Platform 的 rate limits,以因應較高 effort level 的 token 使用量。
如果你正在評估是否採用 Sonnet 5,建議先在自己的典型任務上測試不同 effort level 的 cost-performance 曲線,並參考 Anthropic 公布的 Sonnet 5 System Card 中的完整評測數據。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
