Gemini

Gemini 3.1 Flash Lite 預覽登場:Gemini 3 家族最快最便宜的模型

Google 於 3 月 3 日釋出 Gemini 3.1 Flash Lite 預覽版:輸入每百萬 token 0.25 美元、輸出 1.50 美元,是 Gemini 3 家族最快最便宜的選項。本文解析定價、基準與選型建議。

Gemini 3.1 Flash Lite 預覽登場:Gemini 3 家族最快最便宜的模型 — 文章封面

2026 年 3 月 3 日,Google 發布 Gemini 3.1 Flash Lite 預覽版,透過 Gemini API 在 AI Studio 與 Vertex AI 供應。定位寫得很明白:Gemini 3 系列中「最快、最省成本」的模型,為大流量的開發者工作負載而生。這次發布也打破慣例——上一代 Gemini 3 完全沒有 Flash-Lite,這一輪則跳過標準 Flash、直接先出 Lite 版,時間距 2 月 19 日的 Gemini 3.1 Pro 約兩週。

VentureBeat 估算其成本約為 Pro 的八分之一。對按 token 計費的產品而言,這不是小改版,而是選型矩陣上多出了一個新格子。

定價與速度

價格是每百萬輸入 token 0.25 美元、每百萬輸出 token 1.50 美元,為 Gemini 3 家族最低。前代對照:Gemini 2.5 Flash-Lite 為 0.10 與 0.40 美元——新模型比前代貴了數倍,這是為第三代理力付出的價差。速度方面,The New Stack 引用的數字是每秒最高 363 token,為 Gemini 3 家族最快,比 2.5 Flash-Lite 前代慢 3 token,但仍比同級對手快二至五倍;Google 官方引用 Artificial Analysis 的數據,稱對比 2.5 Flash 的首答 token 時間快 2.5 倍、輸出速度提升 45%,品質相近或更好。

基準成績與同級對手

Arena.ai 排行榜上,Flash Lite 拿到 1432 Elo;GPQA Diamond 86.9%、MMMU Pro 76.8%,在推理與多模態理解上擊敗同級模型,甚至部分更大的前代 Gemini。The New Stack 的對比整理:整體而言勝過 Gemini 2.5 Flash 且更便宜;直接對手 GPT-5 mini 與 Claude 4.5 Haiku 被壓過;Grok 4.1 Fast 更便宜,但明顯更慢。值得注意的是 Google 沒有發布任何 agent 基準——考量到模型的定位宣傳,這個缺席本身就是訊號。另外,消費端 Gemini app 不會搭載這個模型,它純粹是 API 產品。

可調思考等級

Flash Lite 帶來可調的 thinking levels:開發者可以按任務調整模型推理的深淺。這在高頻場景是關鍵的成本槓桿——把推理等級調低,輸出 token 變少,帳單直接下降。Google 展示的場景包含:替電商線稿灌入數百個商品、用即時與歷史資料生成天氣儀表板、執行多步驟的 SaaS 商務 agent、快速分析並分類大量圖片。早期採用者包含 Latitude、Cartwheel 與 Whering,回饋集中在效率與指令遵循。

選型建議

實際選型可以這樣切。大流量的資料處理、翻譯、內容審核,加上 UI 與儀表板生成、複雜指令遵循——這是 Flash Lite 的主場。要協調一堆 agent 的編排層,Google 自己都沒提供基準數據,選 Pro 或專用模型更穩。若你現在跑在 2.5 Flash-Lite 上,遷移前要先算價差:成本漲了數倍,換到的是第三代的多模態理解與推理能力,是否值得取決於你的流量結構對速度與品質的敏感度。預覽期間規格仍可能調整,正式版時程未定。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵