xAI

Grok 4.20 公測:四個代理人先辯論再回話

xAI 於 2026 年 2 月 17 日推出 Grok 4.20 公開測試:內建 Grok、Harper、Benjamin、Lucas 四個代理人,推理時即時辯論、交叉驗證後才輸出。eWeek 報導幻覺下降約 65%,本文拆解運作機制、成本與對開發者的意義。

Grok 4.20 公測:四個代理人先辯論再回話 — 文章封面
本頁內容7 個段落
  1. 不是一個模型,是四個代理人
  2. 辯論迴圈怎麼跑
  3. 帳面數字:參數、成本、算力
  4. 幻覺下降 65% 與實盤交易測試
  5. 從 Grok 4 Heavy 到原生多代理
  6. 開發者該注意什麼
  7. 參考來源

2 月 17 日,xAI 把 Grok 4.20 推進公開測試。這個版本最值得注意的不是單項跑分,而是架構:模型內建四個具名代理人——Grok(船長)、Harper(研究)、Benjamin(邏輯)與 Lucas(創意)——在推理階段即時辯論、互相查核,達成共識後才輸出答案。eWeek 的報導直接把它形容成「一支辯論隊」。

對開發者來說,這是第一個把多代理協作做進模型本體、而非外掛框架的前線模型。如果早期數字站得住,推理期的多代理辯論可能從實驗技巧變成產品預設值。

不是一個模型,是四個代理人

根據 NextBigFuture 的拆解,四個代理人各有明確分工:Grok 負責拆解任務、分配子任務、裁決衝突並撰寫最終綜合;Harper 負責研究與查證,用即時搜尋加上 X 資料流(每天約 6,800 萬則英文貼文)做 grounding;Benjamin 負責數學、程式碼與邏輯的壓力測試;Lucas 負責發散思考、標記盲點與打磨輸出。

關鍵在於這套機制是原生的:它存在於推理過程內部,而不是像 AutoGen 或 Swarm 那樣在模型外側拼裝的框架。OpenRouter 的模型頁也以「業界領先的速度與 agentic tool calling」描述這個 beta 版本。

辯論迴圈怎麼跑

流程分四步。第一步,Grok 拆解任務並派工。第二步,四個代理人平行分析,而非序列處理。第三步,進入多輪內部辯論:Harper 校事實、Benjamin 驗邏輯、Lucas 標記偏見,反覆迭代到共識。第四步,Grok 綜合出單一輸出,代理人的推理軌跡可選擇攤開給使用者看。

簡單查詢不會召集完整議會,只有複雜任務才觸發辯論——這是控制平均成本的手段。

帳面數字:參數、成本、算力

NextBigFuture 引述的數字:約 3 兆參數的 MoE 基底,四個代理人是同一模型的特化副本;宣稱「有效智能」提升 2 至 4 倍;邊際算力成本是單次推理的 1.5 至 2.5 倍(天真做法是 4 倍);強化學習為代理協作帶來約 6 倍效率增益。訓練與推理依托 Colossus 叢集超過 20 萬顆 GPU,四個副本共享權重與 KV cache。

取用方式:消費端透過 SuperGrok(每月約 30 美元)或 X Premium+;API 在 beta 階段尚未完全開放,預期定價高於 Grok 4.1 Fast 的每百萬 token 輸入 0.20、輸出 0.50 美元,Batch API 與快取可再壓低成本。

幻覺下降 65% 與實盤交易測試

eWeek 報導兩個早期結果:內部測試幻覺率下降約 65%,以及在實盤交易測試中勝過對手模型。兩個數字都出自 xAI 自家測試,仍待獨立驗證,但方向與機制一致:查證型代理人握有即時資料流,邏輯型代理人的職責包含說「不」,辯論本身就是一層幻覺過濾器。

從 Grok 4 Heavy 到原生多代理

這條路線其來有自。2025 年 7 月的 Grok 4 Heavy 已嘗試多實例協作,但沒有具名分工與顯式辯論迴圈。Grok 4.20 把它產品化:每個代理人有身分、有職責、有可觀察的互動軌跡。

對照組是 OpenAI 與 Google:兩家的量產堆疊仍以單模型推理、搭配內部搜尋放大為主,多代理停留在框架與研究階段。xAI 等於把一個架構賭注直接推上生產線——推理期協作比單純放大單一模型更划算。這也是 2026 年開局以來 agentic 工程主軸的一部分(延伸閱讀:2026 年 AI 開局展望)。

開發者該注意什麼

三件事。第一,代理人軌跡視覺化會變成除錯介面的標配:當答案由四個代理人協商產生,「為什麼這樣回答」需要新的觀測工具。第二,成本模型改變:1.5 至 2.5 倍的邊際成本,在 agent 工作流裡用一點算力換正確性通常是划算的交易——一個錯誤步驟的連鎖代價遠高於此。第三,單模型 benchmark 已不足以反映辯論後的可靠性,評測對象要從模型換成系統。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵