Qwen

Qwen3.8-27B 開源釋出:體積小、看得懂圖,只是預設想太多

阿里巴巴 Qwen 兌現一週前承諾,釋出 Apache 2.0 的 Qwen3.8-27B 開放權重:262K 上下文、原生視覺、單機可跑;Simon Willison 實測稱讚能力,也點出 xhigh 推理預設讓簡單任務慢上數倍。

Qwen3.8-27B 開源釋出:體積小、看得懂圖,只是預設想太多 — 文章封面

8 月初,阿里巴巴 Qwen 團隊把旗艦 Qwen3.8-Max 開放權重時,順帶預告較小的 27B 版本一週內跟進。8 月 13 日前後,承諾兌現:Qwen3.8-27B 連同 FP8 量化版登上 Hugging Face,授權 Apache 2.0,可自由商用。時間點值得記一筆——同一週,封閉陣營的新聞圍繞訂閱方案與算力合約,開放權重陣營則安靜地把「本地跑得動的能力」往前推了一格。

規格:小體積、長上下文、原生視覺

Qwen3.8-27B 總參數約 278 億,原生上下文 262,144 tokens,可用 YaRN 外插到 100 萬。它是 Qwen3.8 系列第一個釋出權重的小型成員,架構延續 Qwen3.5 基礎:64 層混合布局,Gated DeltaNet 與 Gated Attention 交替堆疊,並搭載多 token 預測(MTP)。它也不是純文字模型,原生支援圖片與影片理解。思考模式預設開啟,推理深度可用 reasoning_effort 調整,而官方模型卡給的預設值是 xhigh——這個選擇後來成了討論焦點。

Willison 實測:能力過關,預設失誤

Simon Willison 在 8 月 16 日發表實測,他在 128GB 的 M5 Max MacBook Pro 上跑 17GB 的 Q4_K_M 量化版,也試了 NVIDIA DGX Spark。結論分兩半。能力面:照片邊界框偵測相當準,一句提示就生出一個可用的標註工具,還能驅動 Pi coding agent 回答程式庫問題、寫出帶測試的 JSONL 轉 Markdown 腳本。速度面卻被預設拖累:「畫一台腳踏車上的鵜鶘」燒掉 22,276 個推理 token 才吐出 3,223 個輸出 token,全程 21 分鐘;關掉推理,同一題 137 秒完成。連「畫一個圓的 SVG」都會觸發一段他沒要的精緻動畫。他的建議很直接:從 low 或關閉推理用起。

速度與生態

本地 15 到 30 tokens/秒的吞吐,對比託管 API 動輒 74(OpenAI 5.6 Sol)到 184 tokens/秒(Luna),稠密模型吃記憶體頻寬的劣勢一覽無遺。不過 llama.cpp 的 MTP 草稿解碼能把吞吐再拉高約 72%。Artificial Analysis 隨後把模型收進索引,給了 52 分的獨立評分。Unsloth 的 GGUF 量化、vLLM 與 SGLang 支援在發布當天就緒;官方自評的 Terminal Bench 2.1 拿 73.0、OSWorld-Verified 拿 84.3,這些數字仍待第三方驗證。

對本地部署的意義

三個要點。第一,17GB 的檔案裝著長上下文、工具呼叫、視覺與程式生成,一年前這是旗艦級能力,現在能離線跑在一台筆電上。第二,「預設值即產品」:xhigh 讓第一次體驗變成漫長等待,社群已經自行改模板把 medium 設為預設,模型廠在預設參數上應該更貼近真實用法。第三,開放權重的節奏沒有放緩,Qwen 一個月內接連開源 Max 與 27B,對需要私有部署的團隊來說,本地選單又多了一個認真候選。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵