2026 年 1 月 26 日(週一),Microsoft 發表第二代自研 AI 加速器 Maia 200。官方定位很明確:一顆「為擴展 AI 推理而生的矽晶片主力戰馬」,單一節點就能「毫不費力地跑起當今最大的模型」,並留有迎接更大模型的餘裕。它接替 2023 年的第一代 Maia 100,是 Microsoft 自研晶片首次真正對準推理規模化。
發表當天,Microsoft 同步向開發者、學術機構與前沿 AI 實驗室開放 Maia 200 SDK。TechCrunch 引述官方說法:它目前已承載 Microsoft 超級智慧團隊的模型、支撐 Copilot 的日常運作——不是投影片上的晶片,而是已在生產環境裡服務。
規格與對比數字
帳面數字:FP4(4 位元)算力超過 10 petaFLOPS,FP8(8 位元)下超過 5 petaFLOPS;超過 1,400 億顆電晶體,塞進 750W 的 SoC 封裝。以 FP4 產品級推理來說,這個數字已被外界形容為踏入 Blackwell 級地盤——直接與 NVIDIA 旗艦推理晶片對位。
Microsoft 也給出對手對比:FP4 效能為 Amazon 第三代 Trainium 的三倍,FP8 則高於 Google 第七代 TPU。廠商自評照例要打折——沒有獨立第三方基準,測試條件也不透明。但發布會上直接點名兩家雲端同業,本身就是宣戰:比較基準已不是「能不能用」,而是「誰的每 token 成本更低」。
為什麼押注推理而不是訓練
Maia 200 的關鍵戰略選擇是「推理專用」。訓練旗艦模型要的是極致叢集規模,市場幾乎被 NVIDIA 獨佔;但推理才是日常營運成本的大頭——每次 ChatGPT 回覆、每次 Copilot 補全,燒的都是推理算力。服務規模越大,推理成本越貼近毛利線。
我們在年初的開年觀察提過,GPT-5.2 之後模型發布節奏明顯加快。模型迭代越快、部署越廣,推理需求成長曲線就越陡,Google(TPU)與 Amazon(2025 年 12 月的 Trainium3)都已押注,Microsoft 現在補上第三票。
自研矽的成本帳
超大規模雲端業者自研晶片的動機不神祕:降低對 NVIDIA 的依賴,並壓低單位推理成本。用自己的晶片跑 Copilot 與模型服務,每一顆都是省下的 GPU 毛利。Constellation Research 的分析把這股趨勢稱為「自訂 AI 矽加速」——不是全面取代外部晶片,而是讓超大規模業者取得議價空間與成本彈性。
對 Microsoft 還有一層:OpenAI、Anthropic 等大客戶的算力合約動輒數百億美元,自研推理晶片能把這些支出部分內部化。
開發者何時碰得到
誠實的答案是:還沒有時間表。Microsoft 未公布正式上線日期,目前 SDK 採邀請制——開發者、學界與前沿實驗室可以申請,一般 Azure 用戶還看不到執行個體選項。這與 Maia 100 的路徑一致:先在內部驗證,再逐步開放雲端目錄。
對開發者的實際意義在於規劃:低精度(FP4/FP8)推理已是不可逆的方向,模型量化、KV cache 管理與推理引擎的最佳化,未來兩三年只會更值錢。至於 Maia 200 何時出現在 Azure 價目表上——那是自研矽從成本故事變成產品故事的時間點。
參考來源
- Maia 200: The AI accelerator built for inference — Microsoft Official Blog
- Microsoft announces powerful new chip for AI inference — TechCrunch
- Microsoft launches Maia 200 as custom AI silicon accelerates — Constellation Research
本文由 AI 協助自上述來源整理,經人工審核後發布。
