Open Models

Z.ai 發表 GLM-5.3:開源程式碼新高,網路攻擊能力超預期

2026 年 8 月 14 日,Z.ai 發表 GLM-5.3:沿用 GLM-5.2 基座、靠後訓練把程式碼基準推上開源新高,並主動披露網路攻擊能力「發展得比我們預期更快」,授權同步轉為自訂條款。

Z.ai 發表 GLM-5.3:開源程式碼新高,網路攻擊能力超預期 — 文章封面
本頁內容6 個段落
  1. 共用 GLM-5.2 基座,贏在後訓練
  2. 程式碼基準:開源新高
  3. 網路能力:原廠自己拉的警報
  4. 授權轉向:從 MIT 到自訂條款
  5. 對開發者的意義
  6. 參考來源

2026 年 8 月 14 日,Z.ai 發表 GLM-5.3,公告標題開宗明義:「前沿程式碼能力,與湧現的網路能力」。發布當天,這則消息在 Hacker News 衝上超過 1,100 點,是本週開源圈最大的新聞。官方的自我定調有兩句:它是「最強的開源權重程式碼模型」;同時,網路能力的發展「比我們預期的更快」。

共用 GLM-5.2 基座,贏在後訓練

GLM-5.3 是 753B 參數的 MoE 模型,最值得注意的一點是:它直接沿用 GLM-5.2 的基座,模型卡原話是「所有提升都來自後訓練」。換句話說,這不是預訓練規模的升級,而是一次徹底的後訓練疊代——推理、工具呼叫與長任務規劃全部重做。這也有經濟意涵:如果一個世代的躍進不必再跑一次預訓練,前沿發布的邊際成本會大幅下降,後訓練管線——資料、獎勵訊號與 agent 環境——就成了真正的核心資產。模型支援 low、high、max 三檔推理強度,預設 max,官方多項評測用到最高 100 萬 token 的上下文。

程式碼基準:開源新高

成績單的量級值得整段列出(均為 GLM-5.3 對 GLM-5.2):Terminal Bench 2.1 從 81.0 升到 88.2;Terminal Bench 3.0 從 4.6 升到 28.3;SWE-Marathon 從 19.4 翻倍到 42.5;DeepSWE v1.1 從 46.2 升到 66.9;FrontierSWE 從 67.5 升到 78.1。官方另宣稱在自家的 Z.ai Code Bench 上比 5.2 提升 50%。這些不是灌水題:Terminal Bench 測的是終端機裡的多步實作,SWE-Marathon 測的是超長工程任務能否持續推進,正是目前 agent 最容易崩潰的地方。這些數字由供應商自行報告,實際手感得等社群複測,但方向一致:長程工程任務的進步幅度,遠大於短題。

網路能力:原廠自己拉的警報

這次發布最不尋常之處,是原廠主動把攻擊面寫進標題。模型卡顯示:CyberGym 拿下 84.5(GLM-5.2 為 77.2),宣稱是漏洞發現任務的開源最高分;ExploitGym 兩小時題從 29 跳到 105,六小時題從 39 跳到 130;ExploitBench 從 24.4 升到 54.4,利用能力翻倍以上。當開源權重模型把漏洞挖掘與利用推到這個水準,防禦方與平台方的應對,不再只是閉源 API 供應商的使用條款問題,而是每一個會下載權重的團隊都得面對的現實。

授權轉向:從 MIT 到自訂條款

GLM-5.2 當時以 MIT 授權開源;GLM-5.3 的權重同樣放上 Hugging Face,但授權換成自訂的專屬條款,不再是標準開源授權。Together、Novita、Fireworks、DeepInfra、Baseten 等推論供應商也已上架,API 取得不是問題;問題在自架時的商用條款,得逐條讀過再上生產。這是 5.2 到 5.3 之間最容易被忽略、卻影響採購決策的變化。

對開發者的意義

三個觀察。第一,開源程式碼前沿的推進方式變了:同一個基座,靠後訓練就能拉開一個世代的差距,後訓練管線本身成了核心資產。第二,供應商自報的基準要打折看,但 SWE-Marathon 翻倍這種量級很難是雜訊,值得直接拿自己的工作負載實測。第三,雙用途能力正式進入開源權重的討論範圍:紅隊、掃描與防禦工具的軍備賽,會比模型排行更值得追蹤。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵