AI Safety

Fable 5 回歸:新分類器擋下 99% 越獄手法

Fable 5 因美國出口管制暫停後於 7 月 1 日恢復;新分類器擋下 99% 越獄手法,四準則嚴重度框架與 Amazon 等共同草擬中。

Fable 5 回歸:新分類器擋下 99% 越獄手法 — 文章封面

2026 年 6 月 12 日,美國政府對 Anthropic 最新模型 Claude Fable 5 與 Mythos 5 實施出口管制,迫使 Anthropic 暫停所有用戶的存取。6 月 30 日管制解除,7 月 1 日起 Fable 5 恢復全球供應,Mythos 5 則先開放給特定美國組織。這起事件不只是政策轉折,更暴露了 AI 安全評估缺乏業界共通的嚴重度標準,Anthropic 因此與 Amazon、Microsoft、Google 聯手推動一套越獄評估框架。

事件時間線:從出口管制到恢復存取

Anthropic 在 6 月 9 日推出 Fable 5 與 Mythos 5,兩者共用相同底層模型,但 Fable 5 帶有較強的安全防護,Mythos 5 則僅提供給 Glasswing 計畫的少數合作夥伴,用於防禦性網路安全。6 月 12 日,政府因 Amazon 研究人員發現繞過 Fable 5 防護的方法而實施出口管制,Anthropic 因無法即時驗證使用者國籍,只能全面暫停存取。

Anthropic 與政府及 Amazon 合作審查後確認,許多較低能力的模型(如 Claude Opus 4.8、GPT-5.5、Kimi K2.7)也能識別相同漏洞,且所有測試模型都能產出同樣的漏洞利用示範。換言之,該技術並未暴露 Mythos 等級的獨特網路能力,僅是 Fable 5 安全邊際內的邊界案例。Anthropic 訓練了新的安全分類器,阻擋該報告描述的特定行為,並在超過 99% 的情況下成功攔截。

安全分類器的運作與取捨

Anthropic 在 Fable 5 上應用了「縱深防禦」策略,其中關鍵是安全分類器——在互動過程中偵測潛在有害的網路安全任務,並阻擋模型回應。分類器刻意設定較大的「安全邊際」,即使請求可能無害,只要有一點風險就會被阻擋,這導致許多合理請求被拒絕,但能更確保有害行為不會漏網。

對產品開發者而言,這代表使用 Fable 5 時可能遇到更多誤擋,尤其是在例行編碼或除錯時。Anthropic 承認新分類器會更頻繁地標記良性請求,並表示會持續調整以減少誤判。這種「寧可錯殺」的取捨,反映了安全與可用性之間的張力,也是開發者在整合這類模型時必須納入考量的因素。

業界共通的越獄評估框架

目前 AI 業界缺乏客觀描述越獄嚴重度的共識,導致開發者難以排定處理優先順序,政府也缺乏行動依據。Anthropic 與 Amazon、Microsoft、Google 及其他 Glasswing 夥伴合作,開始制定一套評估框架,將越獄分為輕微(僅解鎖特定行為)、狹窄有害(解鎖特定有害行為)、以及通用(解鎖一整類有害行為)等層級。

這套框架有助於開發者更系統性地評估新發現的越獄技術,也能讓政府與產業夥伴用一致的語言溝通風險。對產品團隊來說,這意味著未來在評估模型安全性時,可能會有更明確的標準可循,而非依賴個別公司的內部判斷。

對產品開發者的啟示

這次事件凸顯了幾個實務重點。首先,模型供應可能因政策而中斷,開發者應準備替代方案,例如 Anthropic 在 Fable 5 被阻擋時會將請求轉送至 Opus 4.8。其次,安全分類器的誤擋會影響使用者體驗,產品設計時需考慮如何優雅地處理這類拒絕。最後,越獄評估框架的建立,將有助於整個產業更透明地溝通風險,但框架仍在發展初期,實際應用還需觀察。

對正在評估是否採用 Fable 5 的團隊,建議先測試其安全邊際對自身工作流程的影響,並追蹤 Anthropic 後續對分類器的調整。這起事件也提醒我們,AI 模型的部署不只是技術問題,更牽涉法規、安全與產業協作,產品開發者需要具備更全面的視野。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵