Claude

Claude 3.7 Sonnet 的「延長思考」:可調控的推理預算與可觀察的思考過程

Anthropic 在 Claude 3.7 Sonnet 加入可開關的 extended thinking mode,並讓開發者設定 thinking budget。本文整理官方公布的設計取捨、代理能力測試與安全評估,供產品開發者參考。

Claude 3.7 Sonnet 的「延長思考」:可調控的推理預算與可觀察的思考過程 — 文章封面
本頁內容6 個段落
  1. 可觀察的思考過程,以及它的代價
  2. 代理能力:從 OSWorld 到 Pokémon Red
  3. 序列與平行測試時運算的差異
  4. 安全評估:維持 ASL-2,但出現能力提升訊號
  5. 對產品開發者的意義
  6. 參考來源

Anthropic 於 2026 年 7 月 3 日發布的公告中,回顧了 Claude 3.7 Sonnet 的一項重要設計:讓同一個模型可以依照任務難度,選擇投入不同程度的認知努力。這不是切換到另一個模型,而是讓模型在回答前多花時間、多走幾步推理。

對產品開發者來說,最直接的控制點是「thinking budget」。你可以設定 Claude 在一個問題上最多使用多少思考 token,在成本、延遲與答案品質之間取得平衡。

可觀察的思考過程,以及它的代價

Anthropic 選擇以原始形式公開 Claude 的思考過程,理由是信任、對齊研究與趣味性。使用者可以看到模型如何探索不同角度、反覆檢查答案。

但這個設計有明顯的取捨。首先,思考內容沒有經過標準的角色訓練,語氣比一般輸出更疏離、更不個人化,有時會出現不正確或半成形的想法。其次,Anthropic 明確指出「忠實性」問題:顯示出來的文字不一定能完整代表模型內部的決策因素。官方研究顯示,模型常常根據思考過程中沒有明說的理由做決定,因此不能單靠監控思考內容來推論模型安全。

安全與資安也是考量。惡意使用者可能利用可見的思考過程來設計更有效的越獄策略。Anthropic 表示,這個可見思考過程應視為研究預覽,未來版本是否繼續公開,會重新權衡利弊。

代理能力:從 OSWorld 到 Pokémon Red

Claude 3.7 Sonnet 的進步不只來自延長思考,還包括「action scaling」:模型能反覆呼叫函式、回應環境變化,持續執行開放式任務。在 OSWorld 多模態電腦使用評測中,它與前代模型的差距會隨著互動次數增加而擴大。

更直觀的展示是讓 Claude 玩 Game Boy 經典遊戲 Pokémon Red。官方提供螢幕像素輸入、基本記憶體與按鍵函式,讓模型在數萬次互動中持續遊玩。前代 Claude 3.0 Sonnet 甚至走不出初始城鎮的房子,而 Claude 3.7 Sonnet 成功擊敗三位道館館主並取得徽章。Anthropic 認為,這種維持專注、完成開放式目標的能力,將幫助開發者打造更先進的 AI 代理。

序列與平行測試時運算的差異

延長思考屬於「序列測試時運算」:模型在輸出前依序產生多個推理步驟,準確率隨思考 token 數呈對數成長。以 2024 年美國數學邀請賽(AIME)題目為例,允許的思考 token 越多,表現越好,但模型通常不會用完所有預算。

Anthropic 研究團隊也實驗了「平行測試時運算」:同時取樣多個獨立思考過程,再用多數投票或學習評分模型選出最佳答案。在 GPQA 生物、化學、物理難題集上,使用相當於 256 個獨立樣本的運算量、64k token 思考預算與學習評分模型,Claude 3.7 Sonnet 達到 84.8% 的成績,物理子項更高達 96.5%。不過,平行測試時運算尚未部署到正式模型,仍屬研究階段。

安全評估:維持 ASL-2,但出現能力提升訊號

Anthropic 的 Frontier Red Team 與 Alignment Stress Testing 團隊對 Claude 3.7 Sonnet 進行全面評估,結論是現行的 AI Safety Level 2(ASL-2)標準仍然適用。但在化學、生物、放射性與核子(CBRN)武器相關任務的對照研究中,模型輔助的參與者比單純使用網路資訊的參與者進步更多,顯示能力有所提升。

同時,所有嘗試都出現足以阻止任務完成的關鍵失敗。專家紅隊回饋也呈現分歧:部分專家注意到模型在特定 CBRN 領域的知識增加,但關鍵失敗頻率仍然過高。Anthropic 表示會加速部署針對性的分類器與監控系統,並為未來可能需要升級到 ASL-3 做好準備。

對產品開發者的意義

如果你正在設計需要複雜推理或長程代理任務的產品,thinking budget 提供了一個明確的調校旋鈕。但要注意,可見思考過程的內容不保證忠實反映模型決策,不適合直接當作安全監控或解釋性工具。

更務實的做法是:先在小規模任務上測試不同思考預算對成本與品質的影響,再決定是否要在使用者介面中揭露思考過程。Anthropic 自己也把這個功能定位為研究預覽,代表介面與行為未來仍可能調整。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵