2026 年 2 月 16 日,OpenAI 為 ChatGPT 引入兩項安全功能:Lockdown Mode 與 Elevated Risk 標示,目標是防禦 prompt injection 與資料外洩(data-exfiltration)攻擊。OpenAI 的說明中心文件與 Help Net Security 的報導,指向同一套威脅模型。
兩層防禦的設計意圖
從命名可以讀出分工。Elevated Risk 是「標示」——在風險升高的情境下讓使用者知道;Lockdown Mode 是「收緊」——面對高風險情境時限制潛在的危險行為。偵測加上限制,是經典的縱深防禦結構,現在直接內建在產品裡,寫進說明文件、跟著版本更新走。
為什麼是 prompt injection
Prompt injection 是 agent 時代的結構性威脅:當 model 開始讀網頁、收文件、接資料,所有外部內容都是潛在的指令載體——攻擊者不需要碰你的帳號,只要讓模型讀到一段惡意文字。注入成功之後,常見的下一步就是把資料往外送,這正是 data exfiltration 與 injection 被一起防的原因。
ChatGPT 的規模讓這不只是技術議題。同一套防禦上線,等於把安全基線一次推到整個使用者群——這類平台級的預設,影響力遠大於任何單一企業自己做的防護。還有第二層效應:平台先做了,就重新定義了「合理」的標準。當大量使用者習慣在 ChatGPT 裡看到風險標示,企業買家很快就會拿同樣的問題去問每一家助理供應商——功能會變成期待,再變成採購清單上的必選項。
對自建 agent 團隊的啟示
OpenAI 把防禦做成產品功能,自建 agent 的團隊沒有理由落在後面:
- 把外部內容視為不可信輸入,而不是純資料
- 為高風險行為(外部傳輸、檔案寫入、執行指令)設計明確的確認或限制層
- 追蹤平台級防禦的演進,把它納入自己的威脅模型,而不是假設「model 供應商會處理」
二月這一波 agent 能力競速——agent teams、long-horizon 任務、邊緣部署——每一項都擴大攻擊面。Lockdown Mode 的出現提醒我們:能力與風險是同一枚硬幣的兩面,防禦節奏必須跟上發布節奏。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
