OpenAI 在 9 月 3 日的「Path to Astra」一文裡,公布了 Astra 的完整網路安全評測數據。這些數字不只是安全研究者的素材,對一般開發者也有兩個直接相關的訊號:模型在真實工程任務上的能力天花板又移動了,而且它完成同樣工作所需的 token 變少了。
先記住官方的但書:以下所有數據都是 Daybreak Blue 存取層級下的表現,不是一般使用者拿到的預設配置。預設配置會封鎖最先進的網路安全能力。
ExploitBench:從 22% 到 100%
ExploitBench 是 OpenAI 用來測試模型利用真實漏洞能力的基準。GPT-5.6 Sol 在同一套基準上的解題率是 22%,Astra 則是 100%。這不是漸進改善,而是跨過了某條質變的線——上一代模型多數題目做不出來,這一代全部做完。
更值得注意的是測試本身的演化。單一漏洞的公開資料會污染評測(模型可能靠記住公開 exploit 過關),所以 OpenAI 這次把挑戰移植到一個內部版本上:含有 20 個高嚴重度漏洞的私有 V8 build,模型無法從訓練資料裡背出答案。Astra 在這個設定下依然全數解出。
評測中挖出兩個零日漏洞
整個評測過程還產出了意外收穫:Astra 發現了兩個此前未知的新零日漏洞,兩個都已通報廠商,揭露流程正在進行中。官方文件明確表示,公布這些能力是為了讓防禦方有時間部署修補。
這是「評測本身變成漏洞研究」的第一手案例。對安全團隊來說,這預示了一種新的工作模式:高能力模型放在受控環境裡跑攻擊面分析,產出的是可直接行動的防禦情資,而不是分數。
兩條完整攻擊鏈:沙箱逃逸與提權
除了單點漏洞利用,Astra 還展示了兩條多步驟攻擊鏈。第一條是新穎的瀏覽器沙箱逃逸鏈,從網頁環境一路逃出沙箱。第二條是作業系統端的本地提權鏈,從無特權使用者一路拿到 root 權限。
這兩條鏈的意義在於「自主完成」:模型不需要人類在中間補位,自己規劃並執行完整的攻擊序列。這正是 Critical 門檻定義裡最關鍵的條件,也是 Astra 被判定位於該等級的具體證據。
少用 9% token,還拿到更好的結果
對多數開發者來說,這可能是整份報告裡最實用的一行:Astra 平均使用的 token 比 GPT-5.6 Sol 少 9%,而且結果更好。代理式工作負載的成本與延遲都直接吃 token 效率,同樣的預算可以跑更長的任務鏈。
綜合外界報導,Astra 特別擅長代替使用者操作電腦、處理比以往模型更長時間的工作,OpenAI 也將其定位為迄今最強的軟體工程模型。搭配 token 效率的改善,長時間代理任務的經濟性正在快速改善。
給建構者的三個行動項
第一,如果你在做安全相關產品,Astra 級模型的防禦應用已經有官方背書,Daybreak 計畫是取得高權限存取的正式管道。第二,token 效率是模型升級時最容易忽略的紅利,重新校準你的代理任務預算假設。第三,評測數據反映的是 Daybreak Blue 層級,你的應用拿到的是預設配置,規劃能力預期時要把這個差距算進去。
參考來源
- Path to Astra: critical capabilities and frontier safeguards
- OpenAI Rolls Out GPT-6 Astra Model With Added Cyber Guardrails
本文由 AI 協助自上述來源整理,經人工審核後發布。
