當你花數百萬美元訓練的模型,被競爭對手用 API 呼叫偷走能力,你會怎麼做?Anthropic 在 2026 年 2 月 23 日公開了答案:他們偵測到三家 AI 實驗室——DeepSeek、Moonshot、MiniMax——透過約 24,000 個詐騙帳號,對 Claude 發動了超過 1,600 萬次交換的「蒸餾攻擊」。這不是理論上的威脅,而是正在發生的工業級竊取。
蒸餾本身是合法的訓練技術,許多前沿實驗室用它來製作較小、較便宜的模型。但當競爭對手用它來提取別人的能力,就能以極低成本縮短開發時間,而且這些模型往往缺乏原始模型的安全防護。Anthropic 指出,這類攻擊可能讓危險能力(如生物武器開發或惡意網路活動)擴散,甚至被用於軍事或監控系統。
對產品建構者而言,這篇文章的價值不在於政治角力,而在於它揭示了 API 安全與模型保護的實際運作方式。以下我拆解幾個關鍵面向。
攻擊手法:偽裝成正常流量的模式
Anthropic 發現,這些攻擊遵循類似劇本:用詐騙帳號和代理服務繞過地區限制,然後產生大量精心設計的提示詞,目標鎖定 Claude 最強的差異化能力——代理推理、工具使用和編碼。
關鍵在於「模式」而非單一請求。一個看似無害的提示詞,例如要求「結合統計嚴謹性與深度領域知識的資料分析師」,單獨看完全正常。但當它重複數萬次、來自數百個協調帳號、集中於同一能力時,模式就清楚了。Anthropic 用「hydra cluster」來形容這些代理網路:數萬個詐騙帳號分散流量,單一帳號被封鎖就立即替換,沒有單點失敗。
DeepSeek 的操作特別值得注意:他們讓 Claude 想像並寫出完成回應背後的內部推理,等於大規模產生 chain-of-thought 訓練資料。Moonshot 則用數百個帳號橫跨多種存取途徑,後期甚至嘗試重建 Claude 的推理軌跡。MiniMax 的 1,300 萬次交換是最大規模,而且 Anthropic 在他們釋出模型前就偵測到,得以觀察完整生命週期。
偵測與回應:分類器、行為指紋與情報共享
Anthropic 的回應分四層:偵測、情報共享、存取控制、反制措施。他們建立了多個分類器和行為指紋系統,專門識別 API 流量中的蒸餾模式,包括 chain-of-thought 誘導和跨帳號協調活動。同時,他們與其他 AI 實驗室、雲端供應商分享技術指標,並加強教育帳號、安全研究計畫的驗證。
對開發者來說,這代表 API 供應商正在變得更善於區分「正常使用」與「異常模式」。如果你正在建構依賴大型語言模型的產品,這提醒我們:流量監控不只是成本問題,也是安全問題。就像我在結構化資料擷取工具指南中提到的,可驗證性與模式偵測是選擇工具時的關鍵。
值得注意的是,Anthropic 承認沒有單一公司能獨自解決。他們公開證據,是為了讓整個產業、雲端供應商和政策制定者能協調行動。這也呼應了先前Claude 越獄事件的教訓:安全需要生態系統層級的合作。
出口管制的另一面:蒸餾如何削弱管制
這篇文章最尖銳的論點在於:蒸餾攻擊直接破壞出口管制的目的。Anthropic 長期支持出口管制以維持美國的 AI 領先,但這些攻擊讓外國實驗室(包括受中國共產黨控制的)能繞過管制,透過其他方式縮小差距。
更微妙的是,這些實驗室的「快速進展」常被視為出口管制無效的證據。但 Anthropic 指出,這些進展其實大量依賴從美國模型提取的能力,而大規模提取需要先進晶片。因此,蒸餾攻擊反而強化了出口管制的理由:限制晶片存取,同時限制了直接訓練和蒸餾規模。
這個論點對產品建構者有什麼意義?它提醒我們,當你依賴第三方 API 時,你的使用模式可能被視為威脅。如果你正在開發需要大量提示詞的應用,例如自動化測試或資料生成,請確保你的流量模式不會被誤判為蒸餾攻擊。透明地與供應商溝通你的用途,可能比試圖隱藏更有效。
給產品建構者的實際啟示
蒸餾攻擊的偵測依賴於模式辨識,這對任何建構 AI 產品的人都有兩個教訓。第一,監控不應只關注成本或延遲,也應關注流量結構。異常的集中度、重複性和協調性,往往是問題的早期信號。第二,安全防護不應只放在模型層級,也應放在 API 層級——就像 Anthropic 正在開發的產品與 API 層級反制措施。
但這篇文章也有其限制。Anthropic 沒有提供具體的偵測指標或分類器細節,因為這會讓攻擊者更容易繞過。對於想深入了解的人,這可能令人沮喪,但這是安全領域的常見權衡。
最終,蒸餾攻擊的揭露不是為了製造恐慌,而是為了推動協調行動。作為產品建構者,我們能做的,是理解這些攻擊的存在,並在設計系統時將安全視為第一公民,而不是事後補救。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
