OpenAI

OpenAI 撤回 SWE-Bench Pro 建議:約三成題目是壞的

OpenAI 於 2026 年 7 月 8 日公開承認先前推薦的 SWE-Bench Pro 約三成題目有缺陷並撤回採用建議,文中整理四類失敗模式、三層審計流程,與重建編碼評測信任的具體主張。

OpenAI 撤回 SWE-Bench Pro 建議:約三成題目是壞的 — 文章封面
本頁內容6 個段落
  1. 一次罕見的公開自我修正
  2. 為什麼題目會壞掉
  3. 四類失敗模式
  4. 三層審計流程
  5. 對評測生態的意義
  6. 參考來源

2026 年 7 月 8 日,OpenAI 發布文章〈Separating signal from noise in coding evaluations〉,做了一件大型實驗室不常做的事:公開否定自己。結論寫得很直白——「我們估計約 30% 的 SWE-Bench Pro 題目是壞的」,並正式撤回先前採用這個基準的建議。諷刺的是,SWE-Bench Pro 正是 OpenAI 自己先前推薦、用來接替 SWE-bench Verified 的編碼評測。

另一個數字同樣刺眼:短短八個月內,前沿模型在 SWE-Bench Pro 公開切分上的通過率從 23.3% 漲到 80.3%。分數膨脹到這種速度,通常不只代表模型變強。

一次罕見的公開自我修正

審計的規模如下:自動化管線先標記 286 個可疑題目送入深度複查,最終判定 731 題中有 200 題(27.4%)損壞;人類標註更嚴格,249 題(34.1%)被判定有缺陷。每題由五位受訓工程師獨立審查,而在被深入檢視的題目裡,「沒壞」從未成為多數意見。對照 OpenAI 自家 Preparedness Framework 的前提——能力評估必須可信——這次等於承認自家用過的考卷本身出了問題。

為什麼題目會壞掉

根源在題目來源。SWE-Bench Pro 的題目從真實開源儲存庫的 pull request 爬取而來,而這些 PR「最初是為人類協作而生」:維護者與貢獻者來回討論數十則之後才合併。描述、合併的程式碼與單元測試,往往拼不成一個乾淨、自足的評測任務。PR 測試的本質是「驗證某次特定修改」,不是「定義與實作無關的驗收標準」——把人類對話的副產品當成機器考題,噪音從一開始就烤進去了。

四類失敗模式

審計把壞題目歸成四類。第一,過嚴測試:測試強迫題目敘述沒提的實作細節,功能正確的解法照樣被判錯。第二,欠規格敘述:隱藏測試要求的要求,無法從題目合理推出。第三,低覆蓋測試:檢查太少,不完整的修法也能通過。第四,誤導敘述:題目把模型導向與測試相反的行為。原文給了一個殺傷力十足的例子:OpenLibrary 的某道題,範例顯示一個前導空白,隱藏測試卻要求兩個——乖乖照範例走的提交直接被當掉。

三層審計流程

方法論分三層。第一層是自動過濾器,同時審查題目敘述、模型嘗試與評分測試,標記可疑題目。第二層是人機協作複查:以 Codex 為基礎的調查代理,帶著儲存庫與環境的存取權限,實際執行測試、檢視失敗嘗試,反覆掃過之後由研究員定奪。第三層是人工標註戰役:每題五位受訓且經驗豐富的軟體工程師,依題目敘述、測試與黃金修補判定,歧見則升級處理。人類與代理的類別判斷重疊率 74%;在低覆蓋測試一項,人類標出 9.4%,代理只標 4.1%——機器審計抓不到的盲點,仍然要靠人補上。

對評測生態的意義

OpenAI 的三個主張值得抄下來。一、SWE-Bench Pro 的結果要小心解讀,採用建議已經撤回。二、新基準應該由資深軟體工程師「專門為測試模型能力」而寫,難度與真實性靠人類全程把關。三、模型已經強到可以反過來大規模審計評測的題目、測試與修補——缺陷的偵測成本正在暴跌。評測該有的樣子,原文給的標準是:「難以作弊、容易信任、真正反映模型能力」。對所有拿排行榜分數當採購依據的團隊,這篇文章是一記提醒:考卷本身,現在也是需要維護的基礎設施。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵