OpenAI Codex

Codex 5.6 簡評:模型分工、Sol Ultra 與更快見底的額度

從 GPT-5.6 Sol、Terra、Luna 的定位,到 Sol Ultra multi-agent 工作流的實測用量:價格相同,不代表消耗相同。

Codex 5.6 簡評:模型分工、Sol Ultra 與更快見底的額度 — 文章封面

Codex 5.6 讓我最有感的,不只是模型能力,而是用量的計算方式開始更貼近實際工作量。你可以把它理解成一組有不同分工的模型:Sol 處理最難的任務,Terra 平衡能力、速度與成本,Luna 則是最快也最省的選項。官方把這三個層級稱為 GPT-5.6 Sol、Terra、Luna;模型名稱裡的數字代表世代,Sol、Terra、Luna 則代表持續演進的能力層級。OpenAI 的 5.6 發布說明

先釐清一個容易混用的名稱:我平常聽到有人說「Solar multi-agent」,官方名稱其實是 GPT-5.6 Sol;multi-agent 指的是 Ultra mode。Ultra 不只是把單一 agent 的思考時間拉長,而是會調用 subagents 來加速複雜工作。這也是它和一般單 agent 工作流最大的差別。

5.6 三個模型怎麼選

模型 定位 適合的工作
GPT-5.6 Sol 最高能力 複雜 repo、長鏈路除錯、架構判斷、需要反覆驗證的任務
GPT-5.6 Terra 能力、速度與成本的平衡 日常開發、功能實作、一般分析與迭代
GPT-5.6 Luna 最快、最低成本 快速查詢、小型修改、明確且範圍小的任務

如果只是要一個結論:日常工作先用 Terra 或 Luna;只有當任務真的需要深度推理、跨檔案理解與多輪執行時,再把 Sol,尤其是 Ultra,叫進來。把最強模型當成預設,通常不是最有效率的做法。

價格和用量不是同一件事

這次最值得注意的是:在 Codex 的 token-based rate card 裡,GPT-5.6 Sol 的輸入、快取輸入與輸出 credit rate 都和 GPT-5.5 一樣。兩者分別是每百萬 token 125、12.5、750 credits。Terra 約為 Sol 的一半,Luna 則更低。Codex rate card

所以從表面價格看,Sol 沒有比 5.5 更貴。但這不代表一次工作會消耗一樣多。

Sol Ultra 的重點正是多 agent。當它把工作拆給 subagents、讓不同 agent 檢查不同路徑,再整合結果時,背後產生的推理、工具呼叫與輸出都會增加。OpenAI 沒有把 Ultra 公開成一個固定的倍率;不過只要理解它不是單 agent 工作流,就不應把它當成「同一個價格、同一份用量」的模式。

Fast mode 會再把這個差異放大。官方也明確說明,支援模型的 Fast mode 會以更高速度消耗 credits;實際消耗則取決於輸入、快取輸入、輸出,以及任務本身的工作量。

我的實測:20 分鐘,用完 5 小時額度

我今天早上開了 Fast mode,用 Sol Ultra 工作大約 20 分鐘,基本上就把 5 小時的 limit 用完了。

這不是一個可外推到所有帳戶的 benchmark。它也不表示每個 20 分鐘的任務都會得到同樣結果。repo 大小、上下文、子任務數量、工具呼叫、輸出長度和當下的帳戶規則都會影響消耗。但它很清楚地說明一件事:同價,不等於同樣耐用。

以前看 5.5 的價格,很容易只問「新模型有沒有加價?」。現在更實際的問題是:這個任務會不會觸發更深推理、Fast mode 或多 agent 協作?若答案是會,額度的消耗速度可能比你預期快很多。

外部早期回饋:能力感受更強,但還不是定論

我也看了公開的早期討論。現在大家寫 5.6 時,最常見的做法不是宣稱一個絕對贏家,而是先把「官方定位」、「個人實測」和「仍待驗證的部分」拆開。這很重要,因為媒體也指出,目前獨立評測仍然有限。Axios 的早期觀察

社群回饋大致有兩條線。一條是正面感受:有人在 project review 時覺得 Sol Ultra 找到更多問題、對整個 repo 的理解更完整;也有人形容它的工作方式像多個 5.5 agents 被更有結構地協調起來。project review 的早期分享 Codex 討論串

另一條則是額度和速度。有人同樣回報 Sol Ultra 很快耗盡 limit;也有人覺得它比 5.5 沒有明顯更快,只是可能更聰明。這些不是可重複的 benchmark,但和我的經驗一起看,足以支持一個務實判斷:Ultra 的價值應該用「是否減少了人要做的判斷與返工」來衡量,而不是只看一次任務跑了多久。社群的用量與速度討論

我會怎樣使用

我的做法會很直接:

  • 用 Luna 處理問題明確、改動很小的任務。
  • 用 Terra 跑大多數日常開發與正常迭代。
  • 用 Sol 處理需要判斷力的任務,例如複雜除錯、跨模組重構、部署前檢查。
  • 只在任務真的值得並行探索、需要多個角度驗證時開 Sol Ultra。
  • Fast mode 留給有時間壓力的工作,不把它當成預設。

Codex 5.6 的價值不是讓每個任務都開到最大,而是讓我能按任務的難度調度能力。Sol Ultra 很強,但它更像一支短時間、高成本的突擊隊;把它用在真正棘手的問題上,才能把它的價值換成結果,而不是只換成更快歸零的額度。

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵