Benchmarks

NIST CAISI 評測 DeepSeek V4 Pro:距美國前沿約八個月

美國商務部 NIST 旗下的 CAISI 發布 DeepSeek V4 Pro 評測:IRT 估計 Elo 800,約當八個月前的 GPT-5,數學幾乎追平、抽象推理與資安最弱,七項基準中五項比 GPT-5.4 mini 便宜。

NIST CAISI 評測 DeepSeek V4 Pro:距美國前沿約八個月 — 文章封面
本頁內容6 個段落
  1. 這份評測怎麼做
  2. 主要結果:Elo 800 與五領域畫像
  3. 與 DeepSeek 官方報告的落差
  4. 成本優勢與政治脈絡
  5. 對開發者的意義
  6. 參考來源

2026 年 5 月 1 日,美國商務部國家標準與技術研究院(NIST)旗下的 AI 標準與創新中心(CAISI)發布對中國開放權重模型 DeepSeek V4 Pro 的官方評測報告。結論一句話:這是 CAISI 迄今評過最強的中國模型,但整體能力落後美國前沿約八個月,水準接近 2025 年中發布的 OpenAI GPT-5。

這份報告值得開發者注意的不只是排名,而是方法論:CAISI 用預先承諾的基準組合與試題反應理論(IRT)加權,降低污染與「挑軟柿子」的空間。在各方自報分數越來越難比較的 2026 年,一套政府級、可複查的評測程序正在成形,而且未來會直接掛進上市前審查的流程。

這份評測怎麼做

CAISI 的做法有三個特點。第一,基準預先承諾:評測套件在跑分前就定好,不是看結果再挑。第二,使用非公開的保留題目,例如內部打造的 PortBench 與 ARC-AGI-2 半私有集,降低訓練資料污染的風險。第三,控制 token 預算與 scaffolding(模型外部的工作腳手架),讓不同模型在可比條件下作答,再以 IRT 啟發的方法估計整體能力。報告評估五個領域:資安、軟體工程、自然科學、抽象推理與數學。

主要結果:Elo 800 與五領域畫像

核心數字:DeepSeek V4 Pro 的 IRT 估計 Elo 為 800(±28),對照組的 GPT-5.5 為 1260、Opus 4.6 為 999、GPT-5.4 mini 為 749。領域分布很不平均:數學幾乎追平美國頂尖模型——OTIS-AIME-2025 拿下 97%、PUMaC 2024 與 SMT 2025 都是 96%;但抽象推理只有 ARC-AGI-2 半私有集的 46%,資安領域在 CTF-Archive-Diamond 上僅 32%(經 IRT 插補估計)。軟體工程與自然科學同樣落後前沿。最弱的三塊,恰好是 agent 落地最需要的三塊。

與 DeepSeek 官方報告的落差

另一個看點是官方敘事與獨立評測的落差。DeepSeek 自己的技術報告宣稱 V4 Pro 與 Opus 4.6、GPT-5.4 相當——這兩個模型約在兩個月前發布。CAISI 的實測卻把它放回八個月前的 GPT-5 水準。The Decoder 的 Matthias Bastian 指出,這不代表報告造假,而是自選基準、自選對照組的行銷文件與預註冊評測之間的系統性差距——購買決策該看後者。

成本優勢與政治脈絡

成本是 DeepSeek 真正的強項。與唯一符合 CAISI 篩選條件的美國對照模型 GPT-5.4 mini 相比,DeepSeek V4 在七項基準中的五項更便宜,幅度從便宜 53% 到貴 41% 不等。當 agent 工作負載動輒數百萬 token、美國前端模型持續漲價,這個價差會重新排列選型清單——Cursor 已經在中國開放權重的 Kimi K2.5 上微調出更低成本的編碼模型。但政治脈絡不能忽略:The Decoder 同時提醒,Artificial Analysis 的 Intelligence Index 顯示美中差距其實「大致持平」,CAISI 身為政府機構「很可能有自己的政治議程」。年初的開年觀察點出的開源路線分歧,如今又疊上了一層官方評測的視角。

對開發者的意義

三個實際結論。第一,選型看領域而非總分:數學密集的工作 pipeline 可以認真考慮開放權重模型,資安與長鏈推理任務則仍該保守。第二,把 CAISI 的方法論借來用:預先承諾基準、保留題目、固定 token 預算,這套程序比再跑一次公開排行榜更能抵抗污染。第三,注意這份報告的時點——同一週,CAISI 才宣布擴大對美國前沿模型的上市前評測,政府評測正在從研究工具變成監管基礎設施,讀懂它的評法,就是讀懂未來的合規門檻。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵