2026 年 8 月 10 日,Meta Superintelligence Labs 發布 Muse Glimmer:一個 30B 參數的代理模型,權重以 Apache 2.0 授權放上 Hugging Face。定位寫得很清楚——為「常駐本地」的代理工作流而設計,小到能在配單張消費級 GPU 的 Mac 或 PC 上運行,用途涵蓋本地代理、函式呼叫、本地寫程式,以及 LLM-as-a-judge 評測。
這是 Meta 一年多來第一個開放權重模型。在 Llama 4 失利、AI 部門重組、外界質疑 Zuckerberg 開源承諾之後,這次發布的意義不只是「多了一個小模型」。
30B 參數,單張消費級 GPU 就能跑
全精度下,30B 模型需要超過 55 GB 記憶體,消費級 GPU 塞不下,Meta 的解法是量化:4-bit 版本把權重壓到 16 GB 以下,RTX 3090/4090、RX 7900 XT/XTX 這類 20 至 24 GB 的卡就能完整容納。速度方面,Meta 給出的數字是 RTX 5090 上每秒 75 到 233 個 token(高段靠投機解碼),M5 Max 筆電約 26 至 58。軟體端,llama.cpp、MLX、ExecuTorch 整合數日內到位,Ollama 與 LM Studio 已能下載。Simon Willison 實測後給了兩個好評:Apache 2.0 比過去繁瑣的 Llama 授權乾淨得多;模型還具備視覺理解,他用 coding agent 插件直接探索 Datasette 程式庫,結論是 32 GB 記憶體的機器就能舒服地跑。
從教師模型蒸餾代理能力
公告把工程挑戰講得相當坦白:代理要好用,長時程執行、精確工具呼叫、多模態理解、長上下文記憶與指令遵循必須同時到位,而這些能力得塞進本地硬體的記憶體與算力限制裡。Meta 的做法是一套「新穎的蒸餾配方」,把規模大得多的教師模型的代理推理轉移到 30B 學生身上——The Register 點名教師就是旗艦 Muse Spark。官方 benchmark 對比 Gemma4-31B 與 Qwen3.6-27B;Willison 引用的評測則覆蓋 DeepSearchQA、MCP-Atlas、τ-Bench、SWE-Bench 等完整任務基準。
Meta 為什麼重返開源
時間點不難讀。The Register 把背景寫得很直白:Kimi K3、Qwen 3.8-Max、DeepSeek V4 Flash 等中國開放權重模型近月主導新聞週期,美國業界正為「本土開放替代品」焦慮。Meta 靠 Llama 建立開源聲譽,卻在 Llama 4 之後淡出一年多。同一天,Meta 超級智能部門負責人 Alexandr Wang 在 X 承諾「很快」釋出 Muse Spark 1.2 的開放權重版。換句話說,Glimmer 是先鋒,主菜是旗艦模型的開放版本——成色如何,才是檢驗 Meta 開源誠意的指標。
對本地 AI 生態的影響
三件事值得追蹤。第一,30B 級又帶完整代理能力的開放權重模型,會直接拉高本地 coding assistant 與個人代理的可用下限,免網路、免金鑰的代理變成日常。第二,Apache 2.0 讓企業部署沒有法律摩擦,Nous Research 這類社群微調團隊幾乎必然會出衍生版本。第三,別忽略局限:稠密 30B 對上只啟用少數參數的稀疏模型,速度天生吃虧;The Register 也提醒,Qwen 3.8-27B 隨時可能發布,這份對比未必經得起考驗。
參考來源
- Introducing Muse Glimmer — Meta AI Research
- Zuck rekindles open weights Llama drama with Muse Glimmer — The Register
- Introducing Muse Glimmer — Simon Willison
本文由 AI 協助自上述來源整理,經人工審核後發布。
