2026 年 5 月 28 日,Anthropic 發布 Claude Opus 4.8,距離 Opus 4.7 僅 41 天,當天在 API 與各用戶端上架,價格維持每百萬輸入 5 美元、輸出 25 美元不變。官方定位很白:這是迄今最強的程式碼模型,而且「更傾向標記自己工作中的不確定性,更少做出無根據的宣稱」。
這次更新的重點在三件事:可在一個 session 協調上百個子代理的 Dynamic Workflows、可調整的推理投入(Effort),以及 Messages API 的中途 system 條目更新。
41 天的迭代節奏
TechCrunch 點出,41 天的間隔遠快於過往 Opus 世代。背景有兩層:Opus 4.7 的市場反應平淡,以及 OpenAI Codex 與 Google Gemini 3.5 Flash(5 月 19 日發布)的競爭壓力。標準定價維持 4.7 水位;Fast mode 為每百萬輸入 10 美元、輸出 50 美元,速度約 2.5 倍,比舊快速模式便宜 3 倍。Anthropic 把「速度」變成可加價選購的選項。
分數面上的進展
- SWE-bench Pro 從 4.7 的 64.3% 升到 69.2%
- Online-Mind2Web 達 84%,領先 Opus 4.7 與 GPT-5.5
- Artificial Analysis 量到每任務平均少 15% 輪次、35% 輸出 token,但仍比 GPT-5.5 多約 30% 輪次
- GDPval-AA 以 1,890 分登上榜首(較 4.7 高 137 分)
- 自身程式碼缺陷未標記就放行的機率,約為 4.7 的四分之一
留意量測環境:GPT-5.5 在 Terminal-Bench 2.1(Codex CLI harness)為 83.4%,跨模型比較高度依賴 harness 與評測條件。
Dynamic Workflows:一個 session 跑上百個子代理
Dynamic Workflows 以研究預覽進入 Claude Code(Enterprise、Team 與 Max 方案)。模型先規劃工作、在一個 session 內展開上百個平行子代理、再驗證結果。Anthropic 給的場景很具體:橫跨數十萬行程式碼的 codebase 級遷移,從 kickoff 到 merge,以既有測試套件作為通過標準。對手寫 orchestrator 的團隊,編排層正被吸收進模型本身。
Effort 控制與 Messages API
Effort 控制在 claude.ai 與 Cowork 全方案開放,預設為 high,可切到 extra(Claude Code 裡叫 xhigh)或 max,把最貴推理留給困難任務。Messages API 則允許在 messages 陣列中插入 system 條目,任務中途更新指示不再打斷 prompt cache,對長時間運行的 agent 是實質的成本節省。
誠實度與 Mythos 的時程
校準是最被點名的改善,Bridgewater 特別提到模型會主動標記輸入與輸出的問題。Devin 執行長 Scott Wu 認為 4.7 的註解冗長與 tool-calling 問題得到修正;Databricks 在 Genie 場景量到 token 成本比 4.7 低約 61%。對齊上,失準行為率顯著低於 4.7、接近 Mythos Preview;因資安疑慮受限的 Mythos,官方說法是防護強化後「未來幾週」全面開放。
呼應2026 年開年展望的判斷:世代間隔正在縮短,重心從單輪能力移向長任務的可靠度與成本。
參考來源
- Claude Opus 4.8 — Anthropic
- Anthropic releases Opus 4.8 with new dynamic workflow tool — TechCrunch
- Introducing Dynamic Workflows in Claude Code — Claude
本文由 AI 協助自上述來源整理,經人工審核後發布。
