Cybersecurity

N-Day-Bench:用知識截止後的真實漏洞評測 LLM 安全能力

Winfunc 推出 N-Day-Bench:只收錄模型知識截止後才公開的真實漏洞,讓 LLM 在唯讀沙箱中從已知 sink 回溯資料流。首輪 GPT-5.4 以 83.93 居首,GLM-5.1 與 Claude Opus 4.6 緊追在四分之內。

N-Day-Bench:用知識截止後的真實漏洞評測 LLM 安全能力 — 文章封面
本頁內容6 個段落
  1. 為什麼需要「截止日之後」的漏洞
  2. 案例篩選:一千則通告只留四十七件
  3. Curator、Finder、Judge 三角色管線
  4. 首輪成績:前三名擠在四分之內
  5. 怎麼解讀這份榜單
  6. 參考來源

2026 年 4 月 13 日晚間,資安公司 Winfunc 的研究團隊跑完了一輪新基準:N-Day-Bench。它只測一件事——前沿語言模型能不能在真實程式碼庫裡,找出「模型知識截止日之後」才公開的已知漏洞(N-Day)。首輪成績:OpenAI GPT-5.4 以 83.93 分居首,Z.ai GLM-5.1 拿 80.13,Anthropic Claude Opus 4.6 拿 79.95,前三名擠在四分以內;Google Gemini 3.1 Pro 落後超過 15 分。

這份榜單值得看的不只是名次,而是設計。安全評測最常被質疑的問題是污染:模型把訓練資料裡見過的漏洞背下來,在考場上「重播」答案。N-Day-Bench 的回應很直接——每月換題,而且只收錄在受測模型知識截止之後才發布的漏洞通報,讓記憶派不上用場。所有軌跡公開,每個分數都能回溯到具體指令與程式碼。

為什麼需要「截止日之後」的漏洞

靜態題庫會退化成背誦考試,無上限的滾動題庫又讓版本之間無法比較。N-Day-Bench 的折衷是以截止時間戳為錨,每月發布一版,每版題池只含上一版截止之後、這一版截止之前發布的通報;模型名單也每月升級到各家的最新版本與 checkpoint。官方明言:所有模型用同一套 harness、同樣的上下文,「不給 reward hacking 留餘地」。

案例篩選:一千則通告只留四十七件

案例來自 GitHub Security Advisories,透過 GraphQL API 按發布時間倒序掃描。入選條件很嚴:通報必須明確寫出儲存庫(不能從套件名推測)、儲存庫星數超過一萬、且指向恰好一個無歧義的修補 commit。篩選以 500 則為一個視窗推進,直到湊滿 50 個名額;本月這輪掃了 1,000 則通告,只接受 47 件,剔除 953 件。測試環境 checkout 的是修補 commit 的唯一父節點,也就是修補前的脆弱狀態;修補 diff 只交給出題者,對受測模型保密。多儲存庫、merge commit 等歧義案例直接丟棄,並以 round-robin 方式按儲存庫輪流挑選,避免單一熱門專案霸佔題庫。官方立場寫得很白:小而乾淨的資料集,勝過靠猜測拼湊的大資料集。

Curator、Finder、Judge 三角色管線

出題的 Curator 固定使用 GPT-5.4(medium 推理等級),閱讀通報上下文與修補摘要後產出結構化題目與答案 key:預期漏洞類型、涉及組件、sink 路徑、必要證據。受測的 Finder 拿到題目與一個唯讀 bash shell,最多 24 步工具呼叫,且一律從已知 sink 出發往回做資料流追蹤,而非開放式找洞。評分的 Judge 同樣固定 GPT-5.4,只看到以摘要命名的盲化標籤。沙箱規則:唯讀 overlay 檔案系統掛載在 /workspace、git 被 shim 成唯讀版本、每道指令 12 秒逾時,並限制呼叫深度與 awk、sed 迴圈次數。評分採五維 rubric:目標對齊 30%、source-to-sink 推理 30%、影響與可利用性 20%、證據品質 10%、過度聲稱控制 10%。

首輪成績:前三名擠在四分之內

GPT-5.4 以 83.93 居首(44 份提交、平均 1.07 個發現);GLM-5.1 拿 80.13,平均每份提交 1.23 個發現是全場最高;Claude Opus 4.6 拿 79.95(43 份、1.16);Moonshot Kimi K2.5 拿 77.18(37 份);Gemini 3.1 Pro 只有 68.50,平均發現數 0.91 也是最低。整輪在 4 月 13 日傍晚 5 點 03 分開跑、8 點 53 分結束,約 3 小時 50 分,零失敗。頂部這麼擁擠,說明「給定 sink 回溯污染源」這種受限任務已被前沿模型大致攻克,差距更多反映在報告品質而非找不找得到;Gemini 超過 15 分的落差則值得 Google 團隊深究。

怎麼解讀這份榜單

三個保留。第一,Curator 與 Judge 都是 GPT-5.4,而 GPT-5.4 同時是參賽者兼榜首;盲化標籤能降低偏誤,但網站自己也承認擋不住文風指紋與長度相關偏誤。第二,Judge 一次輸出整個分數物件,伺服器端不做加權重算,用彈性換掉了機械一致性。第三,從已知 sink 出發的回溯追蹤,比真實世界的開放式漏洞挖掘簡單得多,分數不應直接外推到賞金獵人情境。即便如此,「每月換題、全程留痕、唯讀環境」這三件事,已讓它成為目前少數可信的 LLM 安全能力追蹤指標;Winfunc 本身就在賣自動審計程式碼的 AI agent,榜單同時是自家產品能力的公開展示。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵