AI Infrastructure

Microsoft Maia 200 登場:FP4 破 10 petaFLOPS 的自研推理晶片

2026 年 1 月 26 日,Microsoft 發表第二代自研 AI 加速器 Maia 200:FP4 算力超過 10 petaFLOPS、1,400 億顆以上電晶體、750W 封裝,宣稱 FP4 效能為 Amazon Trainium3 的三倍。本文解析規格對比與自研矽的成本帳。

Microsoft Maia 200 登場:FP4 破 10 petaFLOPS 的自研推理晶片 — 文章封面

2026 年 1 月 26 日(週一),Microsoft 發表第二代自研 AI 加速器 Maia 200。官方定位很明確:一顆「為擴展 AI 推理而生的矽晶片主力戰馬」,單一節點就能「毫不費力地跑起當今最大的模型」,並留有迎接更大模型的餘裕。它接替 2023 年的第一代 Maia 100,是 Microsoft 自研晶片首次真正對準推理規模化。

發表當天,Microsoft 同步向開發者、學術機構與前沿 AI 實驗室開放 Maia 200 SDK。TechCrunch 引述官方說法:它目前已承載 Microsoft 超級智慧團隊的模型、支撐 Copilot 的日常運作——不是投影片上的晶片,而是已在生產環境裡服務。

規格與對比數字

帳面數字:FP4(4 位元)算力超過 10 petaFLOPS,FP8(8 位元)下超過 5 petaFLOPS;超過 1,400 億顆電晶體,塞進 750W 的 SoC 封裝。以 FP4 產品級推理來說,這個數字已被外界形容為踏入 Blackwell 級地盤——直接與 NVIDIA 旗艦推理晶片對位。

Microsoft 也給出對手對比:FP4 效能為 Amazon 第三代 Trainium 的三倍,FP8 則高於 Google 第七代 TPU。廠商自評照例要打折——沒有獨立第三方基準,測試條件也不透明。但發布會上直接點名兩家雲端同業,本身就是宣戰:比較基準已不是「能不能用」,而是「誰的每 token 成本更低」。

為什麼押注推理而不是訓練

Maia 200 的關鍵戰略選擇是「推理專用」。訓練旗艦模型要的是極致叢集規模,市場幾乎被 NVIDIA 獨佔;但推理才是日常營運成本的大頭——每次 ChatGPT 回覆、每次 Copilot 補全,燒的都是推理算力。服務規模越大,推理成本越貼近毛利線。

我們在年初的開年觀察提過,GPT-5.2 之後模型發布節奏明顯加快。模型迭代越快、部署越廣,推理需求成長曲線就越陡,Google(TPU)與 Amazon(2025 年 12 月的 Trainium3)都已押注,Microsoft 現在補上第三票。

自研矽的成本帳

超大規模雲端業者自研晶片的動機不神祕:降低對 NVIDIA 的依賴,並壓低單位推理成本。用自己的晶片跑 Copilot 與模型服務,每一顆都是省下的 GPU 毛利。Constellation Research 的分析把這股趨勢稱為「自訂 AI 矽加速」——不是全面取代外部晶片,而是讓超大規模業者取得議價空間與成本彈性。

對 Microsoft 還有一層:OpenAI、Anthropic 等大客戶的算力合約動輒數百億美元,自研推理晶片能把這些支出部分內部化。

開發者何時碰得到

誠實的答案是:還沒有時間表。Microsoft 未公布正式上線日期,目前 SDK 採邀請制——開發者、學界與前沿實驗室可以申請,一般 Azure 用戶還看不到執行個體選項。這與 Maia 100 的路徑一致:先在內部驗證,再逐步開放雲端目錄。

對開發者的實際意義在於規劃:低精度(FP4/FP8)推理已是不可逆的方向,模型量化、KV cache 管理與推理引擎的最佳化,未來兩三年只會更值錢。至於 Maia 200 何時出現在 Azure 價目表上——那是自研矽從成本故事變成產品故事的時間點。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵