Gemini

Gemini 3 Deep Think 更新:從奧賽金牌走向研究級數學

2026 年 2 月 11 日,Google DeepMind 更新 Gemini 3 Deep Think:IMO-ProofBench Advanced 最高可達 90%,數學代理人 Aletheia 能承認失敗,並在 18 個研究問題上產出論文。本文解析推理縮放、Erdős 猜想實績與取得方式。

Gemini 3 Deep Think 更新:從奧賽金牌走向研究級數學 — 文章封面
本頁內容7 個段落
  1. 從奧賽金牌到研究級推理
  2. Aletheia:會承認失敗的數學代理人
  3. 90% 的 IMO-ProofBench Advanced 與推理縮放
  4. 18 個研究問題的實績與自我設限
  5. 取得方式與限制
  6. 為什麼開發者該關注
  7. 參考來源

2026 年 2 月 11 日,Google DeepMind 在官方部落格發布 Gemini 3 Deep Think 的重大更新。這個專為專業研究設計的推理模式,目標不是把奧賽題解得更快,而是在數學、物理與電腦科學研究者指導下處理開放式研究問題。文章由 Thang Luong 與 Vahab Mirrokni 帶隊,Terence Tao 位列致謝——DeepMind 把「AI for Science」當主戰線的訊號很明確。

從奧賽金牌到研究級推理

Deep Think 是 Gemini 3 的專門推理模式。DeepMind 表示,它在 2025 年夏季的國際數學奧林匹亞(IMO)達到金牌水準,稍後版本在 ICPC 追平同等標準。這次更新的主角是 2026 年 1 月版本:在內部評測中顯著超越 IMO 金牌版本,而且用更低的推理算力達到更好的推理品質。換句話說,能力還在往上走,成本曲線同時在往下走。

Aletheia:會承認失敗的數學代理人

更新中最值得工程師注意的是 Aletheia——以 Deep Think 為核心的數學研究代理人。它用自然語言驗證器檢查自己的證明、可以透過 Google 搜尋與網頁瀏覽查文獻,而且設計上允許「承認失敗」。

這對 agent 工程極為關鍵:不會說「我做不到」的研究代理人,比流暢產出錯誤證明的更危險。自然語言驗證器也讓數學家能用習慣的方式審查機器推理。

90% 的 IMO-ProofBench Advanced 與推理縮放

在 IMO-ProofBench Advanced 上,Deep Think 隨推理期算力增加最高可達 90%,而且 DeepMind 報告這條縮放曲線一路延伸到博士級習題(內部 FutureMath Basic 基準)。對產品團隊的含義直接:當品質可以用算力換,準確率、延遲與成本就成了同一組可調旋鈕。

18 個研究問題的實績與自我設限

DeepMind 給出罕見具體的實績清單:跨 18 個研究問題,產出至少一篇 ICLR 2026 接受論文。亮點包括 Feng26(算術幾何 eigenweights 的全自主論文)、在 Bloom 的 Erdős 猜想庫 700 個開放問題中自主解出 4 個(含 Erdős-1051)、用三元素反例推翻 2015 年的線上次模最佳化猜想,並協助 STOC 2026 論文審稿。

報告同時自我設限:目前只達 Level 2「可發表品質」,沒有 Level 3 或 4 突破——這種克制反而提高可信度。

取得方式與限制

Deep Think 目前在 Gemini App 向 Google AI Ultra 訂閱者開放;API 端僅限獲選的研究者、工程師與企業透過 Early Access Program 申請,尚未進入一般 pay-as-you-go 的 Gemini API。Demis Hassabis 隨後在 X 宣布這次升級在「最嚴格的數學與科學基準」上創下新紀錄;India Today 的後續報導則指出它在 Humanity’s Last Exam 拿到及格分數。

為什麼開發者該關注

三點。第一,驗證器設計:自然語言驗證加上「允許失敗」是可借鑑的 agent 架構模式。第二,推理算力作為產品變數:90% 背後是一條可控的品質—成本曲線,值得寫進 eval 與定價設計。第三,差異化戰場從通用基準轉向專業研究工作流。延續2026 開年觀察的路線分歧:Deep Think 選「往深處走」,同週開源陣營正「往便宜走」。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵