2026 年 8 月 12 日,SpaceXAI 發布 Grok 4.6,距離 Grok 4.5 僅一個多月。當天,Artificial Analysis 刊出獨立評測:智能指數 61 分,較 Grok 4.5 上漲 5 分,追平 GPT-5.6 Sol(max),僅次於 Claude Opus 5(max,63 分)與 Claude Fable 5(62 分),小幅領先 Kimi K3。Hacker News 上官方發布與評測兩則討論合計接近千分。一次「小步快跑」的版本更新,把 SpaceXAI 重新送回前沿集團。
分數:重回前沿集團
61 分意味著什麼?與 GPT-5.6 Sol(max)同檔,落後 Claude 兩款旗艦一到兩分。分項上,GDPval-AA v2 的 Elo 達到 1753,僅次於 Claude Opus 5,與 Claude Fable 5、Qwen3.8 Max 在統計上打平。值得留意的是兩份成績單的口徑差異:x.ai 自家公布的評測表宣稱在 GDPVal-AA、CursorBench v3.2、AA-Briefcase 與 Harvey LAB 領先,但也老實列出 DeepSWE 落後 GPT-5.6 Sol Max(65.9% 對 73%)——廠商自評肯認劣勢項目,在 2026 年的前沿發布裡仍然少見。
代理任務是真正的戰場
Artificial Analysis 的分析把 Grok 4.6 的長處講得很直白:能同時在知識工作、客戶服務與終端機任務保持競爭力的模型不多,它「在每一項代理評測上都站在成本對效能的帕累托前緣」。關鍵在輪次效率——完成任務平均約 53 個輪次、累積輸入 token 約 5 億;對照 Claude Opus 5(max)約 103 個輪次、20 億 token。代理工作流的實際成本主要由輪次數與上下文累積決定,這個差距代表真實帳單遠低於單價表呈現的差距。
價格不變的意義
定價維持 Grok 4.5 的水準:每百萬 token 輸入 2 美元、輸出 6 美元,快取命中從 0.3 美元微調至 0.5 美元;context window 維持 50 萬 token。Artificial Analysis 估算的單題成本為 0.84 美元,與 Kimi K3 相同,比 Claude Opus 5(5/25 美元)與 GPT-5.6 Sol(5/30 美元)便宜六成以上。前沿模型換代不加價,在 2026 年是反常事件——智能上漲通常伴隨漲價。當輸出 token 單價主宰推理密集工作流的成本,這個價差會直接寫進團隊的選型決策。
可用性與開發者入口
發布即上架 Cursor 與 Grok Build,API 經 console.x.ai 提供,合作通路包括 OpenRouter、Vercel 與 Cloudflare。技術上,x.ai 說明這一版加長了補充訓練、以 Grok 4.5 重新生成並過濾 SFT 軌跡,並在寫程式、知識工作、核心最佳化、網頁開發與 CAD 上跑代理式強化學習;官方形容模型更會「先自我檢查,再往下走」,視覺與互動專案的一次過關率提升。首週 Grok Build 與 Cursor 提供雙倍用量,「fast」變體單價翻倍。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
