模型升級的新聞多半在講更聰明,但 2026 年 8 月 13 日 Cerebras 與 OpenAI 共同宣布的 GPT-5.6 Sol Ultrafast 服務層,講的是另一件事:更快。這個先在 OpenAI API 上線、由 Cerebras 硬體驅動的新檔位,把 GPT-5.6 Sol 的輸出速度推到每秒 750 個 token,而且官方說法是「不犧牲任何品質」。
對建構即時應用的開發者來說,速度本身就是新能力。當回應時間從分鐘級壓縮到接近即時,許多原本不可行的產品形態會突然變得可行。
750 token/s 是什麼概念
用第三方評測機構 Artificial Analysis 的輸出速度數據來對比:GPT-5.6 Sol Ultrafast 比 Anthropic 的 Claude Fable 5 快 11 倍,比 Opus 4.8 的 Fast mode 快 5 倍。每秒 750 個 token 的輸出,代表一段 3,000 字的長回應大約四秒就能吐完——這已經進入「對話感」的延遲範圍。
Cerebras 強調重點不是峰值速度的數字遊戲,而是前沿智慧第一次能以即時速度提供。模型能力與推理速度原本是兩條路,這次開始合流。
晶圓級引擎:把權重留在晶片上
速度的來源是硬體架構。Cerebras 的 Wafer-Scale Engine 在一片晶圓大小的晶片上塞了 44 GB 的 SRAM,模型權重全部留在晶片內,token 在層與層之間跨晶圓流水線處理。傳統 GPU 推理的瓶頸是把權重在不斷搬進搬出 HBM 記憶體,頻寬就是天花板;權重不上路,這個瓶頸直接消失。
Cerebras 也表示這個架構會隨模型變大平滑擴展——這句話是對未來幾代模型的承諾,值得持續驗證。
實測:HLE 快 7 倍、GDP-Val 快 5.6 倍
兩個實測數據值得記下來。第一,Humanity’s Last Exam 全部 2,500 題,Ultrafast 跑完只花 11 小時 11 分,Claude Fable 5 則要 78 小時 27 分——約 7 倍加速,且準確率相當(測試於 7 月 10 日至 15 日透過 Codex 與 Claude Code 以 xhigh 推理強度進行)。第二,在 GDP-Val 上拿到 5.6 倍的端到端加速,品質沒有退化。
「準確率相當」是關鍵:這不是用蒸餾或縮小模型換速度,而是同一個模型跑在頻寬不再是約束的硬體上。
即時代理是最大受益者
Cerebras 點出的適用場景很有針對性:生產事故的根因分析、網路攻擊的即時應變、需要即時互動的代理工作流程,以及回應時間直接影響價值的法律、金融與工程工作。共同點是「等不起」——多一分鐘延遲就是多一分鐘損失。
目前 Ultrafast 仍是有限預覽,只開放給部分客戶,容量擴充後才會逐步開放。定價尚未公布。對產品規劃者來說,現在值得做的是把「延遲敏感」的工作流程辨識出來,等存取開放時直接遷移。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
