7 月 31 日,DeepSeek 為 V4-Flash 推出 0731 版本。官方更新日誌寫得直白:V4-Flash-0731 保持與先前的 Preview 版「相同的模型架構與規模,僅重新後訓練」。改動集中在代理(agent)能力上,官方稱基準結果「遠超 V4-Pro-Preview」,同時 API 原生支援 Responses API,並針對 Codex 特別調校。這次只有 V4-Flash API 升級,V4-Pro API 與 APP、WEB 端模型維持不變。
一個 Flash 定位的模型,宣稱基準越過自家 Pro 系列,這件事本身就是訊號:代理工作負載的競爭,已經不是只有旗艦模型在打。
架構不變,重訓後半場
官方公布的代理基準分數相當具體:Terminal Bench 2.1 拿下 82.7,NL2Repo 54.2,CyberGym 76.7,DeepSWE 54.4,Toolathlon(verified)70.3,Agent Last Exam 25.2。測試條件也一併公開:DeepSeek Harness 的 minimal 模式、max effort、top_p 0.95、溫度 1.0——不是靠挑環境才漂亮的分數。
原生支援 Responses API 這一點值得單獨看。這是 OpenAI 主推的介面規格,DeepSeek 還特別註明「為 Codex 調校」。一家開放權重實驗室把相容性直接做到 Codex 的工具鏈上,等於把競爭從模型分數推進到開發者的接線成本:本來要多寫一層轉接,現在直接換個模型名稱就能跑。
第三方數據:智能指數 35 分、每秒 210 個 token
Artificial Analysis 對 0731 版的測評給出更清楚的座標:智能指數(Intelligence Index)拿到 35 分,在 113 個模型裡排第九,遠高於同類中位數的 18 分。速度是更突出的強項——輸出每秒 210.1 個 token,全站排第三,首 token 延遲 0.98 秒;同尺寸開放權重模型的中位數只有 66.8。
價格維持 DeepSeek 一貫的激進:輸入每百萬 token 0.44 美元、輸出 1.32 美元,混合價約 0.23 美元,快取命中再打折。模型是 284B 總參數、13B 激活的 MoE,上下文 1M token,權重以 MIT 授權開放、可商用。要挑的毛病也有:評測期間它生成約 2.4 億個輸出 token,明顯高於中位數的 1.4 億——回答偏長,實際成本會比帳面價格再高一些。
對開發者的意義
三件事。第一,代理工作負載的成本曲線又往下探了一段:擠進智能指數前十的模型,輸出單價只有主流閉源旗艦的零頭,還能自托管。第二,「凍結架構、只重訓後訓練」的更新方式值得借鏡——這是把研究模型快速變成產品模型最省力的路徑,介面不動,使用者不必重新接線。第三,介面跟著生態走:原生 Responses API 加上 Codex 調校,說明開源陣營的競爭已經延伸到工具鏈相容性,不再只是榜單排名。
順帶一提,4 月上線時的 deepseek-chat 與 deepseek-reasoner 兩個舊別名已在 7 月 24 日停用;如果還有舊程式碼指著它們,遷移已經不是可選項。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
