GLM-5.3-Flash

Ox Alpha 就是 GLM-5.3-Flash:MIT 開源,OpenRouter 週流量佔 31%

智譜揭曉匿名冠軍 Ox Alpha 就是 GLM-5.3-Flash 並以 MIT 授權開源:預覽期在十萬顆國產晶片上處理 62 兆 tokens,OpenRouter 週流量佔 31%、登頂程式碼模型榜,消息公布當日港股大漲逾 12%。

Ox Alpha 就是 GLM-5.3-Flash:MIT 開源,OpenRouter 週流量佔 31% — 文章封面

2026 年 8 月 26 日,智譜 AI(Z.ai)正式開源 GLM-5.3-Flash,同時揭曉一個懸案:先前匿名掛上 OpenRouter、直接衝上程式碼模型榜首的「Ox Alpha」,就是 GLM-5.3-Flash 的預覽版本。消息公布後,智譜港股收盤大漲逾 12%,報 1,160 港元。

這次發布有兩層值得拆開看:一層是行銷手法——先讓模型匿名證明實力,再揭露身份;另一層是基礎設施——整個預覽期的推理服務跑在十萬顆中國自產晶片上。

Ox Alpha 之謎:先稱霸排行榜,再揭曉身份

預覽期間,Ox Alpha 在 OpenRouter 與 OpenCode 兩個平台合計處理了 62 兆 tokens。身份揭曉後的頭三天,光是 OpenRouter 就湧入超過 11 兆 tokens,被平台稱為「史上最大規模的發布」。截至 8 月 27 日(週四),它是 OpenRouter 上排名第一的程式碼模型,單週處理 10.3 兆 tokens,約占全平台週流量的 31%。

對開發者社群來說,這種「盲測先行」的模式並不陌生,但很少有大陸模型用匿名方式在全球平台上拿下這樣的佔比。真實負載資料比任何 benchmark 截圖都更有說服力。

十萬顆中國晶片上的推理服務

《南華早報》報導的重點在硬體:GLM-5.3-Flash 的高調預覽全程跑在一個由十萬顆中國自產晶片組成的叢集上。在北京推動降低對 Nvidia 先進晶片依賴、美國出口管制持續收緊的背景下,這被視為「中國本土硬體能否承載大規模全球推理負載」的一次實戰檢驗——而這次,服務撐住了 62 兆 tokens 的需求。

模型定位與開源條款

GLM-5.3-Flash 是 GLM-5 系列第一個原生多模態模型,支援文字與視覺輸入,應用場景包括影像描述、視覺問答與文件理解。Emergent 的報導指出,官方在發布當下未公布詳細的 benchmark 分數與參數規格,定位明確:給延遲與成本敏感、不需要峰值精度的使用場景,對標 Claude 3.5 Haiku、GPT-4o mini 與 Gemini 1.5 Flash 這一級的輕量模型。

授權採 MIT——允許無限制的商用、修改與再散布,比 Apache 2.0 或自訂研究授權更寬鬆,沒有廠商鎖定與授權金問題。權重可在 Hugging Face 與 GitHub 下載,API 則透過智譜自有平台與 Cloudflare 等第三方供應,也納入 GLM Coding Plan,並與主流 coding agent 相容。

對開發者的實際意義

三個觀察。第一,輕量開源模型的競爭軸線已經從「分數」轉向「每 token 成本 × 可自由部署」;MIT 授權讓 GLM-5.3-Flash 在後者給到最滿。第二,OpenRouter 的實際用量數據是比 benchmark 更可靠的採購參考——31% 週流量代表大量開發者已經用生產負載投票。第三,供應鏈多元化不再只是政策口號:一個能承載全球流量的非 Nvidia 推理叢集已經實際運轉過。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵