2026 年 6 月 10 日,Google 發布實驗性開源模型 DiffusionGemma,把「文字擴散」(text diffusion)路線推進 Gemma 家族:以 Gemma 4 為基礎、借鏡 Gemini Diffusion 研究,採 Apache 2.0 授權,權重放上 Hugging Face(google/diffusiongemma-26B-A4B-it)。
它的賣點只有一個,但很硬:速度。專用 GPU 上文字生成最快達自回歸模型的 4 倍,單張 H100 每秒超過 1,000 個 token,消費級 RTX 5090 也有 700 以上。
擴散式生成為什麼快
自回歸模型一次只吐一個 token,瓶頸卡在記憶體頻寬。DiffusionGemma 改用「畫布」(canvas)式生成:先鋪一排 256 個隨機佔位 token,再反覆迭代修正——每輪鎖定已確定的 token 作為下一輪上下文,直到收斂。雙向注意力讓每個 token 都能看到彼此,瓶頸從記憶體頻寬移轉到算力。模型卡補充:prefill 由自回歸編碼器處理並保留 KV cache,解碼端對畫布做雙向注意力,低批次、FP8 設定下單張 H100 可超過每秒 1,100 token。
雙向生成也擅長「非線性」任務:行內編輯、程式碼 infilling、胺基酸序列、數學圖形;由 Unsloth 微調的版本甚至能解數獨——官方點名這是自回歸模型很吃力的任務。
26B-A4B:塞進消費級顯卡的 MoE
規格是 26B-A4B 的 MoE:模型卡記載總參數約 25.2B、每次推理啟動 3.8B,128 個專家中動用 8 個,外加 1 個共享專家。它是多模態 image-text-to-text 模型:內建約 550M 參數視覺編碼器,支援 60 秒內影片、256K 上下文、262K 詞彙表,開箱即用 35 種以上語言(預訓練涵蓋 140 種)。量化後官方說它「舒服地塞進 18GB VRAM」的高階消費顯卡。
品質代價:多數基準仍輸 Gemma 4
Google 沒有迴避代價。對比同架構的 Gemma 4 26B-A4B:MMMU Pro 54.3% 對 73.8%、AIME 2026(無工具)69.1% 對 88.3%、GPQA Diamond 73.2% 對 82.3%、MMLU Pro 77.6% 對 82.6%;唯一贏的項目是 HLE 無工具(11.0% 對 8.7%)。官方建議追求最高品質的應用直接用標準版 Gemma 4。提速場景也有限制:數據針對本地與低併發推論,高 QPS 雲端服務的平行解碼「效益遞減,甚至導致更高的服務成本」,Apple Silicon 統一記憶體機種也吃不到同等加速。取樣上官方推薦 Entropy-Bounded Denoising:最多 48 步、溫度從 0.8 衰減到 0.4。
生態:推論與微調工具都到位
推論端支援 MLX、vLLM(由 Red Hat 支援)與 Hugging Face Transformers,llama.cpp「即將支援」;微調端有 Hackable Diffusion(JAX)、Unsloth 與 NVIDIA NeMo 三條路。雲端側已上架 Gemini Enterprise Agent Platform 的 Model Garden 與 NVIDIA NIM,並針對 RTX 5090/4090、Hopper 與 Blackwell 提供 NVFP4 kernel。
對開發者的實際意義
三個判斷。第一,它不是日用主力模型的替代品,而是特定場景的快炮:本地推論、行內編輯、程式碼補洞、需要全域視野的生成任務。第二,llama.cpp 支援一旦落地,消費級硬體的文字生成體驗會被重新定義——18GB VRAM 的門檻代表大部分遊戲卡都吃得到。第三,Google 用 Apache 2.0 開放擴散路線,等於邀請整個生態一起驗證這個架構賭注(延伸閱讀:2026 AI 開年展望)。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
