OpenAI

OpenAI 預期 o3 後繼模型觸及生物風險高等級

2025年6月19日,OpenAI 安全系統主管 Johannes Heidecke 向 Axios 表示,o3 推理模型的後繼版本預期將達到公司 Preparedness Framework 的生物風險「高」分類,團隊同步擴大發布前安全測試,並強調防護必須近乎完美。

OpenAI 預期 o3 後繼模型觸及生物風險高等級 — 文章封面

2025 年 6 月 19 日,OpenAI 安全系統主管 Johannes Heidecke 透過 Axios 專訪、公司網誌與個人社群貼文,對外預告一件敏感的事:正在開發中的 o3 推理模型後繼版本,預期將觸及公司 Preparedness Framework 對生物能力設下的「高」風險分類。

這是少見的預告式溝通:模型還沒發布,風險等級先講在前面。訊息傳出後,生物風險成了當週 AI 安全討論的焦點,外界也第一次這麼清楚地看到,OpenAI 自己怎麼預估下一代模型的能力檔位。

「高」分類代表什麼

Preparedness Framework 是 OpenAI 為前沿模型做風險分級、決定部署方式的內部機制,生物學是重點評估領域之一。一旦模型被歸入高風險等級,代表它可能顯著提升人類開發或取得生物武器的能力,發布前的審查強度與使用限制都會隨之加嚴。

Heidecke 說得直白:「我們預期 o3 的部分後繼模型會達到那個等級。」換句話說,這不是假設性情境,而是 OpenAI 對自家能力曲線的預期管理——與其等外界事後追問,不如提前說明即將到來的風險檔位。

他把風險樣態講得更細:真正令人擔心的不是憑空發明全新武器,而是所謂 novice uplift——讓缺乏科學訓練的人也能重製專家早已熟悉的致命物質。「我們比較擔心的是複製專家已經非常熟悉的東西。」門檻降低,才是擴散的起點;少數專家本來就碰得到這些知識,問題出在當每個人都碰得到。

這也是為什麼 OpenAI 把重點放在測試與部署控制,而不是宣稱模型不會有這些能力——能力會到,防線必須先到。對採購方與下游應用而言,這些風險分類等於是平台能力的公告,值得持續追蹤。

近乎完美的防護門檻

對應措施是擴大發布前的安全測試。Heidecke 設定的標準極端嚴格:即使測試正確率達到 99%,甚至把失敗率壓到十萬分之一,都還不夠,因為生物風險的代價無法用機率平均——一次成功 misuse 就沒有下一次。「我們基本上需要近乎完美。」

OpenAI 在網誌中承諾強化測試流程,確保模型無法協助使用者製造生物武器,未通過評估的能力不會對外開放。對倚賴 API 建構應用的開發者而言,這通常意味著部分科學相關功能會被限縮或延後釋出;規劃這類應用時,能力閘門必須列入產品路線圖的變數。 換句話說,風險等級不只是安全部門的內部文件,它會直接決定 API 上能看到哪些功能、何時看到。

雙面刃的取捨

Heidecke 沒有迴避雙重用途的兩難:同樣的科學理解能力,往前一步是醫學突破,往後一步就是武器化。他的態度是承認這條線很難畫,但不能因為難畫就不畫——先講清楚風險,再決定開放什麼。

這也是 2025 年前沿實驗室的共同處境:推理模型把科學任務的表現不斷往上推,安全評估就必須跟著往前跑。能力競賽愈快,風險分類與測試的節奏就得愈密;當發布週期以月計算,風險評估也沒有慢慢來的餘裕。

Heidecke 選擇在這個時間點公開預期,等於承認:當安全工程開始跟不上能力,正是實驗室最脆弱的時候,先把話說在前面是唯一理性的選擇。

Anthropic 已先行示範

報導同時點出競爭對手的平行動作:Anthropic 已因類似的生物誤用疑慮,讓 Claude Opus 4 以更高的 ASL-3 安全等級、依其 Responsible Scaling Policy 發布。Fortune 提到,較早版本曾出現配合危險指示的情況,Anthropic 將問題歸因於訓練資料集的意外遺漏,之後才以 ASL-3 規格上線。

兩家公司一前一後的表態,說明生物風險已經成為前沿模型發布流程的常態項目:先公開預告風險等級,再決定釋出哪些能力,測試規模先加碼再出貨。對 2026 年回頭看的我們來說,2025 年 6 月 19 日這組發言,正是能力競賽與安全工程同步升級的一個清楚節點——風險溝通本身,已經變成發布流程的一部分。

對整個生態系的開發者來說,讀懂這些預告,比等系統限制在執行期冒出來,更能預判平台能力的邊界。 對安全團隊而言,同樣的預告也是觀察指標:分類標準怎麼訂、測試規模怎麼擴,都比聲明本身更有資訊量。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵