Anthropic

Claude Opus 4.8 發布:Dynamic Workflows 與更誠實的程式碼模型

Anthropic 在 41 天後推出 Claude Opus 4.8:價格不變,新增可協調上百個子代理的 Dynamic Workflows 與 Effort 控制,SWE-bench Pro 升至 69.2%,Mythos 預告數週內開放。

Claude Opus 4.8 發布:Dynamic Workflows 與更誠實的程式碼模型 — 文章封面
本頁內容6 個段落
  1. 41 天的迭代節奏
  2. 分數面上的進展
  3. Dynamic Workflows:一個 session 跑上百個子代理
  4. Effort 控制與 Messages API
  5. 誠實度與 Mythos 的時程
  6. 參考來源

2026 年 5 月 28 日,Anthropic 發布 Claude Opus 4.8,距離 Opus 4.7 僅 41 天,當天在 API 與各用戶端上架,價格維持每百萬輸入 5 美元、輸出 25 美元不變。官方定位很白:這是迄今最強的程式碼模型,而且「更傾向標記自己工作中的不確定性,更少做出無根據的宣稱」。

這次更新的重點在三件事:可在一個 session 協調上百個子代理的 Dynamic Workflows、可調整的推理投入(Effort),以及 Messages API 的中途 system 條目更新。

41 天的迭代節奏

TechCrunch 點出,41 天的間隔遠快於過往 Opus 世代。背景有兩層:Opus 4.7 的市場反應平淡,以及 OpenAI Codex 與 Google Gemini 3.5 Flash(5 月 19 日發布)的競爭壓力。標準定價維持 4.7 水位;Fast mode 為每百萬輸入 10 美元、輸出 50 美元,速度約 2.5 倍,比舊快速模式便宜 3 倍。Anthropic 把「速度」變成可加價選購的選項。

分數面上的進展

  • SWE-bench Pro 從 4.7 的 64.3% 升到 69.2%
  • Online-Mind2Web 達 84%,領先 Opus 4.7 與 GPT-5.5
  • Artificial Analysis 量到每任務平均少 15% 輪次、35% 輸出 token,但仍比 GPT-5.5 多約 30% 輪次
  • GDPval-AA 以 1,890 分登上榜首(較 4.7 高 137 分)
  • 自身程式碼缺陷未標記就放行的機率,約為 4.7 的四分之一

留意量測環境:GPT-5.5 在 Terminal-Bench 2.1(Codex CLI harness)為 83.4%,跨模型比較高度依賴 harness 與評測條件。

Dynamic Workflows:一個 session 跑上百個子代理

Dynamic Workflows 以研究預覽進入 Claude Code(Enterprise、Team 與 Max 方案)。模型先規劃工作、在一個 session 內展開上百個平行子代理、再驗證結果。Anthropic 給的場景很具體:橫跨數十萬行程式碼的 codebase 級遷移,從 kickoff 到 merge,以既有測試套件作為通過標準。對手寫 orchestrator 的團隊,編排層正被吸收進模型本身。

Effort 控制與 Messages API

Effort 控制在 claude.ai 與 Cowork 全方案開放,預設為 high,可切到 extra(Claude Code 裡叫 xhigh)或 max,把最貴推理留給困難任務。Messages API 則允許在 messages 陣列中插入 system 條目,任務中途更新指示不再打斷 prompt cache,對長時間運行的 agent 是實質的成本節省。

誠實度與 Mythos 的時程

校準是最被點名的改善,Bridgewater 特別提到模型會主動標記輸入與輸出的問題。Devin 執行長 Scott Wu 認為 4.7 的註解冗長與 tool-calling 問題得到修正;Databricks 在 Genie 場景量到 token 成本比 4.7 低約 61%。對齊上,失準行為率顯著低於 4.7、接近 Mythos Preview;因資安疑慮受限的 Mythos,官方說法是防護強化後「未來幾週」全面開放。

呼應2026 年開年展望的判斷:世代間隔正在縮短,重心從單輪能力移向長任務的可靠度與成本。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵