LLM

PrismML 推出 1-bit Bonsai:把 8B 模型壓進 1.15 GB 的端側 LLM

2026 年 3 月 31 日,Caltech 衍生新創 PrismML 走出 stealth,發表號稱首款可商業化的端到端 1-bit LLM 家族 Bonsai:8B 旗艦僅 1.15 GB、比 16 位元同級小 14 倍,以 Apache 2.0 開源上架 Hugging Face。

PrismML 推出 1-bit Bonsai:把 8B 模型壓進 1.15 GB 的端側 LLM — 文章封面
本頁內容6 個段落
  1. 端到端 1 位元:沒有高精度逃生門
  2. 分數與密度:解讀 70.5 這個數字
  3. 速度、能耗與代理任務實測
  4. 從 Caltech 實驗室到 Khosla 押注
  5. 對開發者的實際意義
  6. 參考來源

2026 年 3 月 31 日,總部位於 Pasadena 的新創 PrismML 走出 stealth,發表 1-bit Bonsai 系列——號稱全球第一批「可商業化」的端到端 1-bit 大型語言模型。旗艦 Bonsai 8B 有 82 億參數,整份權重只佔 1.15 GB;同級 16 位元模型動輒 16 GB,體積差距 14 倍。權重以 Apache 2.0 授權上架 Hugging Face。

意義在於:極端量化長期被當成「能跑但不能用」的玩具,PrismML 的主張剛好相反——1-bit 不是訓練後的事後壓縮,而是從頭以二元權重訓練的原生架構。如果這條路成立,手機、機器人與穿戴裝置上能塞進去的本地模型檔位,會整個上移一級。

端到端 1 位元:沒有高精度逃生門

市面上多數低位元模型其實混搭高精度元件,號稱 1.58-bit 的方案往往在關鍵層保留 FP16。PrismML 強調 Bonsai 是「true 1-bit, end to end」:embedding、attention 層、MLP 層到 LM head 全部 1 位元,「沒有高精度逃生門」。家族有三個尺寸:8B(1.15 GB)、4B(0.5 GB)、1.7B(0.24 GB),全部在 Google TPU v4 上訓練。

白皮書還點出更遠的紅利:若未來出現 1-bit 專用硬體,乘法可以換成加法,能耗與延遲還有再下降的空間。

分數與密度:解讀 70.5 這個數字

先講誠實的部分:Bonsai 8B 的基準平均 70.5,低於 Qwen3 8B 的 79.3。細項是 MMLU Redux 65.7、MuSR 50.0、GSM8K 88.0、HumanEval+ 73.8、IFEval 79.8、BFCLv3 65.7。絕對分數確實輸一手。

但 PrismML 提出另一個衡量角度:intelligence density,定義為錯誤率取負對數後除以模型體積。Bonsai 8B 算出 1.06/GB,Qwen3 8B 只有 0.10/GB,差距 10.6 倍。對儲存與記憶體受限的裝置來說,這才是決定「放不放得進去、跑不跑得動」的指標——Qwen3 8B 的 FP16 權重是 16.38 GB,手機上根本沒有座位。

速度、能耗與代理任務實測

官方實測數字:M4 Pro Mac 上每秒 131 token、RTX 4090 上 368 token、iPhone 17 Pro Max 約 44 token、iPhone 17 Pro 約 40 token——對照的 16 位元 1B 模型只有 23 token,8B 級 1-bit 模型在旗艦手機上反而更快。能耗方面,M4 Pro 每 token 0.074 mWh、iPhone 17 Pro Max 0.068 mWh,整體能源效率宣稱提升 4 到 5 倍。

代理場景的展示更直觀:同一組工具呼叫任務,Bonsai 8B 完成 50 項,標準 16 位元 8B 模型只完成 6 項。若數字屬實,最大的受益者會是那種「瓶頸不在推理能力、而在塞不進裝置」的離線代理應用。

從 Caltech 實驗室到 Khosla 押注

技術來自 Caltech 研究與專屬授權 IP,共同創辦人 Hassibi 是 Caltech 教授並親任 CEO。資金來自 Khosla Ventures 與 Cerberus Ventures,加上 Google 與 Caltech 提供的算力補助——等於一家賭「模型更小」的新創,拿到了「把模型做大」陣營的錢。

Vinod Khosla:「AI 的未來不會由誰能蓋出最大的資料中心來定義。」Cerberus 的 Amir Salek(前 Google TPU 負責人)更直接:「電力已經成為擴充 AI 資料中心的最終瓶頸。」Hassibi 則把路線講得保守:「我們把 1-bit 視為起點,而非終點。」

對開發者的實際意義

三個實際影響。第一,部署路徑當天就能跑通:Apple 生態走 MLX、NVIDIA 走 llama.cpp 的 CUDA 後端、Windows 與 Linux 從 GitHub 出發。第二,Apache 2.0 代表商用沒有附加條件,離線翻譯、裝置端摘要、本地代理這類產品可以直接疊在 Bonsai 上,不必再過法務這關。第三,70.5 的平均分提醒你選型邏輯:這是「密度優先」的模型,取代雲端旗艦不在它的劇本裡——該問的是你多在乎每 GB 的能力,而不是絕對 SOTA。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵