7 月 16 日,SpaceXAI 發布 Grok 4.5,定位一句話就能講完:他們迄今最聰明的模型,專攻 coding、agentic tasks 與 knowledge work。但真正值得細看的不是單一 benchmark 分數,而是整體形狀——它在部分項目稱霸、部分項目明顯落後,同時用官方宣稱的兩倍 token 效率與四分之一用量,把戰場從「誰最強」轉到「誰最划算」。
定位:與 Cursor 共訓的工程工作主力
官方對 Grok 4.5 的能力範圍描述得很具體:從 Rust、C/C++ 這類系統語言的工程工作,到用單一 prompt 生成完整應用。它不是往通用旗艦的概念發展,而是明確往工程執行收斂。訓練過程與 Cursor 合作(官方用語是 trained alongside Cursor),這一點有實質意義:coding agent 的評分情境直接來自真實開發工具的使用方式,而不是純學術測試。這也解釋了為什麼發布當天它就同步進入 Cursor 的全方案,而不是只掛在 API console 上等使用者自己接。對已經重度使用 coding agent 的團隊,這代表另一件事:模型與 harness 是成對評估的,換模型時 harness 的行為也要重測,不能只看 API 相容性。
Benchmark 全景:勝負混合,不是全面稱霸
官方成績單必須整張攤開看。贏的項目很明確:SWE Marathon pass@1 以 29.0% 居首,領先 Opus 4.8 的 26.0% 與 Fable 的 24.0%;Terminal Bench 2.1 拿 83.3%,只落後 Fable 的 84.3% 一分,再以 0.1 分之差居 GPT 5.5 的 83.4% 之後。但 DeepSWE 的兩個版本就不是這個故事:1.0 版拿 62.0%,落後 Fable(max) 的 66.1% 與 GPT 5.5(xhigh) 的 64.31%,高於 Opus 4.8(max) 的 55.75% 與 Opus 4.7(max) 的 40.12%;1.1 版換用 mini-swe-agent harness 後掉到 53%,輸給 Fable 的 70%、GPT 5.5 的 67% 與 Opus 4.8 的 59%,只贏過 GLM 5.2 的 44%。SWE Bench Pro 的 64.7% 同樣落在中段,前面有 Fable 的 80.4% 與 Opus 4.8 的 69.2%。
| Benchmark | Grok 4.5 | 該項最佳對手 | Grok 位置 |
|---|---|---|---|
| SWE Marathon pass@1 | 29.0% | Opus 4.8 26.0% | 居首 |
| Terminal Bench 2.1 | 83.3% | Fable 84.3% | 第三,落後前兩名 1.0 與 0.1 分 |
| SWE Bench Pro | 64.7% | Fable 80.4% | 中段偏上 |
| DeepSWE 1.0 | 62.0% | Fable(max) 66.1% | 落後前兩名 |
| DeepSWE 1.1 | 53% | Fable 70% | 明顯落後 |
這張表的重點不是排名,而是「勝負混合」這個事實本身。DeepSWE 兩個版本尤其值得對照:同一個模型,從 1.0 的 62.0% 掉到 1.1 的 53%,中間只換了 harness(1.1 改用 mini-swe-agent)——九個百分點的擺幅,比多數模型之間的差距還大。換一個 harness、換一組 repository 與評分方式,模型的相對位置就會移動,這不只是 Grok 4.5 的問題,而是整個 agentic benchmark 生態的現況。另一個必須交代的是資料屬性:這些數字全部出自 SpaceXAI 的官方公告,對手分數取自各家 system card 或 leaderboard,並不是同一團隊在相同環境下重跑的結果。拿來篩選候選模型合理,直接當採購排名就過頭了;真正有結論力的比較,永遠是你自己的 repo、自己的測試套件、自己的時間限制。
訓練:數十萬任務與跑數小時的 rollouts
訓練投資不小:官方稱動用數萬顆 NVIDIA GB300。RL 涵蓋數十萬個任務,集中在 multi-step 軟體工程,評分混用自動指標與模型評分,rollouts 可以連續跑數小時。這個細節比聽起來重要:agent 的工作單位不是一次生成,而是一整段編輯、測試、修正的循環,訓練環境必須允許這種長度的軌跡,模型才有機會學到跨步驟的紀律。回頭看 benchmark 的勝負分布,這也提供了另一種讀法:在貼近這種訓練形態的任務(terminal 操作、marathon 式的長跑修復)它就贏,在環境更受限、工具更精簡的 harness 它就輸——訓練形態與評測形態的貼合度,本身就是預測它在你的工作負載上表現的最佳線索。
效率經濟學:80 TPS、四分之一 token、$2/$6
官方真正想講的故事大概在這裡。速度上,fast-model 跑到約 80 TPS,官方稱比 flash models 更快。token 帳更直接:SWE Bench Pro 上 Grok 4.5 平均輸出 15,954 tokens,約是 Opus 4.8(max) 67,020 的四分之一(1/4.2)。官方並宣稱整體 token efficiency 約兩倍、任務步驟數少於一半——注意這兩句是官方宣稱,尚未有第三方驗證。
把定價放進來看:$2/M input、$6/M output。如果 token 用量是旗艦對手的四分之一、速度又是 fast-model 等級,那麼即使單場勝率不是最高,intelligence per unit cost 很可能才是它真正的賣點。對跑大量 agent 任務的團隊來說,每任務總成本本來就比單張榜單的冠軍更貼近採購決策;Grok 4.5 等於是把這個角度直接產品化。不過帳要算完整:官方宣稱的兩倍效率與減半步驟若在水準之內,省下的是 token 與往返;但若你的任務正好落在它輸掉的類型(例如 DeepSWE 1.1 那種 harness 下的長鏈修改),重試次數增加會直接吃掉效率優勢。效率經濟學成立的前提,是你的工作負載落在它贏的那幾類。
怎麼取得:預設、全方案、限時免費
Grok 4.5 已是 Grok Build 的預設模型,並提供 Excel、PowerPoint、Word、Outlook 外掛——後者提醒你它的定位不只是寫程式:knowledge work 與辦公室文件工作也在官方劇本裡,只是這次發布的證據重心確實壓在 coding。即日起在 Grok Build、Cursor 全方案與 SpaceXAI console 都能用,其中 Grok Build 與 Cursor 限時免費,console API 依牌價計費——「限時免費」要照字面理解:這是上市窗口的行銷定價,不是常態,成本規劃仍應以 $2/$6 的牌價估算,免費期結束後的帳單不會有緩衝。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
