2026 年 6 月 24 日,Google DeepMind 宣布把「電腦操作」(computer use)能力直接內建到 Gemini 3.5 Flash。過去這項能力只以獨立的 Gemini 2.5 電腦操作模型形式存在,如今成為主線 Flash 模型的原生工具,與函式呼叫、Search grounding、Maps grounding 並列。開發者可以在同一個模型裡組合這些工具,打造能「看、推理並在瀏覽器、行動裝置與桌面環境中行動」的代理。
官方由產品經理 Mateo Quiros 發布,定位在長時程與企業自動化任務,例如持續性軟體測試,以及跨專業應用程式的知識工作。Google 展示了兩個示範:模型分析 Gemini 應用程式後回傳分類過的功能清單,以及審查自家文件的無障礙問題。
從獨立模型到原生工具
這次更新的重點不只是「多了新能力」,而是能力的位置變了。過去要做電腦操作,開發者得呼叫一個專門的舊模型,再想辦法把結果接回主流程;現在 Gemini 3.5 Flash 本身就能操作圖形介面,代理可以在同一輪推理裡決定要呼叫 API、搜尋網路,還是直接動手點選畫面。
這對代理架構是實質簡化。電腦操作最適合的場景,是沒有 API 可用的舊系統與桌面軟體;當它變成 Flash 級模型的內建工具,等於把「最後一哩的介面自動化」補進 Google 的代理工具鏈。
取得途徑同步開放:開發者與企業可透過 Gemini API 與 Gemini Enterprise Agent Platform 使用,另有限定互動示範環境與 GitHub 上的參考實作可直接取用。
OSWorld:78.4 分落在哪
The Decoder 的報導引述 OSWorld 基準成績:Gemini 3.5 Flash 拿下 78.4 分。對比其他模型:超過 Gemini 3 Flash 的 65.1、GPT-5.4 mini 的 72.1、Gemini 3.1 Pro 的 76.2,追平 Anthropic Claude Sonnet 4.6 的 78.4,距離 GPT-5.5 的 78.7 僅一步之遙;目前榜首是 Anthropic Opus 4.8 的 83.4。
把這些數字放在一起看,圖像很清楚:電腦操作已進入「前排互咬」階段,前幾名差距在誤差範圍內,沒有一家拿到斷層領先。Google 官方稱這是該公司在代理式電腦操作任務上「迄今最佳表現」,但沒有提供獨立第三方驗證。
安全設計:對抗訓練與企業防護
能操作真實介面的代理,最大風險是提示注入:惡意網頁或文件中的指令,可能劫持代理去執行非預期動作。Google 的第一道防線是針對性的對抗訓練,降低模型在線上環境被注入攻擊誤導的機率。
第二道防線是兩項可選的企業級防護:其一,敏感或不可逆的動作必須先取得使用者明確確認;其二,偵測到間接提示注入時自動中止任務。Google 同時建議採取多層防禦:安全沙箱、人類在環驗證與嚴格的存取控制,三者缺一不可。
對代理開發者的實際意義
三個直接影響。第一,選型邏輯改變:當 Flash 級模型在 OSWorld 與旗艦模型打成平手,「要不要為電腦操作多付旗艦價」變成值得重新計算的問題。第二,安全預設值成為差異點:確認機制與注入中止是開箱選項,等於把企業採購最在意的安全條款做進平臺層。第三,電腦操作從展示技術走向日常工程——文件審查、無障礙檢查、持續測試這類枯燥但高價值的流程,是它最先落地的地方。提示注入風險仍需自行評估,沙箱與人類監督不可省略。
參考來源
- Introducing computer use in Gemini 3.5 Flash — Google
- Google bakes computer control directly into Gemini 3.5 Flash — The Decoder
本文由 AI 協助自上述來源整理,經人工審核後發布。
