OpenAI 在 3 月 26 日公告、並於 3 月 27 日經 SecurityWeek 等媒體報導後,正式確認推出 Safety Bug Bounty 計畫。這不是另一個傳統的資安獎金:它委由 Bugcrowd 平台營運,付錢徵求的是「不構成資安漏洞、但會造成實質傷害」的 AI 濫用與安全風險——第三方提示注入、資料外洩攻擊,以及 Agent 產品在使用者授權下執行不當行為。
對開發者而言,這是第一線大廠第一次把「行為層面的 AI 風險」變成有明確提交管道與計價規則的商品化回報體系。當 Agent 產品大規模部署,攻擊面已經從記憶體漏洞轉移到「模型做了不該做的事」,這個計畫等於替整個產業畫出了問題分類的草圖。
涵蓋範圍:不算是資安漏洞的風險也付錢
根據公告,計畫涵蓋幾類過去多半被資安計畫退件的問題:
- 第三方提示注入(prompt injection)與資料外洩攻擊
- Agentic 產品大規模執行未經允許的行為,以及其他有害的產品行為
- OpenAI 專有資訊暴露、帳號與平台完整性弱點
- 可能造成實質傷害的設計或實作缺陷,包括繞過濫用防護機制
- Connectors 與 MCP 整合方的漏洞,若可被利用來造成實質傷害
明確點名的標的,是會代替使用者做事或存取資料的產品:Atlas Browser、Codex、Operator、Connectors 與其他 ChatGPT 工具。
獎金結構與提交門檻
獎金上限是 7,500 美元,條件是「可一致重現」的高嚴重度問題,且報告必須附上清楚的建議步驟或緩解方案。OpenAI 說明,最終獎金與是否給獎屬裁量事項;對於構成「直接通往使用者傷害」的缺陷,若伴隨可具體執行的修正步驟,也可能個案認定給獎。
換句話說,能不能領賞的關鍵不是找到問題,而是把問題寫成可重現、可修復的工程文件。模糊的「模型表現不好」或一次性無法重現的異常,都不在給獎範圍。
為什麼 Agent 產品是核心標的
把點名清單攤開看,方向很清楚:風險集中在「模型替你操作電腦」的產品。Operator 瀏覽網頁、Codex 動 repository、Connectors 透過 MCP 接上第三方服務——這些場景裡,惡意內容不需要攻破任何軟體,只要以文字形式進入上下文,就可能讓 Agent 執行攻擊者想要的動作。
這也是為什麼 MCP 整合方被明確寫進範圍:一個有漏洞的 connector,等於替所有接上它的 ChatGPT 使用者擴大了攻擊面。OpenAI 把責任邊界畫到第三方整合,等於告訴 Agent 生態系的開發者:你的實作品質直接影響平台風險。
與既有資安獎金計畫的分工
OpenAI 既有的 Bug Bounty 計畫處理傳統軟體漏洞,新計畫走相同規則並外加若干補充。提交案件由 Safety 與 Security 兩個 Bug Bounty 團隊共同分類,並可能在兩個計畫之間轉送——一個回報進來的問題若同時涉及安全與濫用,不會因為「不歸我管」被退回。
另外,這與針對生物安全風險的 Bio Bug Bounty 是各自獨立的計畫,三條管道對應三類風險:傳統漏洞、產品濫用、生物安全。
對開發者與資安團隊的意義
三個實際影響。第一,做 Agent 或 MCP 服務的團隊多了一個正式通報管道,也多了一張官方認定的「什麼算實質傷害」的清單,可以直接拿來當威脅模型的前提。第二,獎金水準(高嚴重度 7,500 美元)相對保守,社群已有人質疑這類計畫的實際給付意願與金額能否吸引頂級研究員投入;能否形成有效的防線,要看後續實際給付紀錄。第三,計畫把「可重現性加緩解建議」定為硬門檻,等於把 AI 安全回報推向工程化:模糊的政策批評不會被計價,能重現、能修復的攻擊路徑才會。
參考來源
- Introducing the OpenAI Safety Bug Bounty program — OpenAI
- OpenAI Launches Bug Bounty Program for Abuse and Safety Risks — SecurityWeek
- Week in review: NIST updates DNS security guidance — Help Net Security
本文由 AI 協助自上述來源整理,經人工審核後發布。
