Open Models

Hugging Face 釋出 450M 開源機器人模型 SmolVLA

2025年6月初,Hugging Face 開源 450M 參數的視覺-語言-動作模型 SmolVLA,可跑在 MacBook 或單一消費級 GPU 上,並以非同步推論堆疊把任務完成時間縮短約30%,為低成本開源機器人生態提供基礎模型。

Hugging Face 釋出 450M 開源機器人模型 SmolVLA — 文章封面
本頁內容6 個段落
  1. 450M 的小模型,對抗更大對手
  2. 資料從哪來:社群資料集的規模化
  3. 非同步推論:快約30%的任務完成
  4. 權重、配方與硬體門檻
  5. 開源機器人生態的競賽
  6. 參考來源

Hugging Face 在 2025 年 6 月 3 日發表開源的視覺-語言-動作(VLA)模型 SmolVLA,TechCrunch 於 6 月 4 日以「效率高到能跑在 MacBook 上」為題跟進報導。這是一個只有 450M 參數的小模型,卻想在機器人領域複製 LLM 社群那套「開源權重加上社群資料」的玩法。

對機器人開發者來說,重點不在模型多大,而在門檻多低:SmolVLA 的目標是讓一般實驗室甚至個人工作室,都能在消費級硬體上跑自己的機器人大腦。

450M 的小模型,對抗更大對手

SmolVLA 由兩部分組成:視覺與語言理解沿用 SmolVLM2 的骨幹(SigLIP 視覺編碼器加上 SmolLM2 解碼器),動作專家(action expert)只佔約 100M 參數。Hugging Face 聲稱它在模擬與真實環境的表現優於規模大得多的 VLA 模型,也勝過 ACT 等基線方法。

TechCrunch 的報導把重點放在同一件事上:以小勝大。在機器人學習領域,多數前沿 VLA 模型的參數規模遠高於此,訓練成本也以叢集等級計算;SmolVLA 想證明的是,任務成功率不必用參數堆出來。從應用看,VLA 模型要解決的問題很具體:把攝影機看到的畫面和使用者下達的指令,轉成機械臂實際的關節動作。過去這通常需要為每個任務單獨訓練策略;VLA 的價值在於一個模型就能泛化到多種任務。這正是 SmolVLA 用 450M 參數挑戰整個產業假設的地方。

資料從哪來:社群資料集的規模化

SmolVLA 的預訓練資料全部來自相容授權的社群資料集:Hugging Face Hub 上以 lerobot 標籤整理出約 487 個資料集、約 1,000 萬幀影像,以 30 FPS 記錄、集中在低價的 SO-100/SO-101 機械臂,總訓練軌跡少於 3 萬條。

官方數字中最值得注意的是資料集規模化效應:在 SO-100 真實機械臂任務上,加入社群資料集預訓練,把成功率從 51.7% 推到 78.3%,絕對提升 26.6 個百分點。模擬環境的基準則涵蓋 LIBERO 與 Meta-World。換句話說,別人共享的資料直接變成了自己的成功率——這正是 LLM 社群「開源飛輪」的邏輯。當然,模擬與真實環境仍有落差,官方數字也以 SO-100 系列硬體為主;跨機型、跨任務的泛化能力,還需要社群用更多實驗來檢驗。

非同步推論:快約30%的任務完成

SmolVLA 還帶了一個工程上的亮點:非同步推論堆疊(asynchronous inference stack)。傳統 VLA 把感知與動作預測綁在同一條序列上,機器人要等下一組動作區塊算完才動;非同步版本把動作執行與區塊預測解耦,用提早觸發、解耦執行緒與區塊融合,讓動作連續不中斷。

按官方數據,這讓任務完成時間從 13.75 秒縮短到 9.7 秒,快約 30%;在固定時間內的完成量接近翻倍,成功率維持在約 78%。對需要在動態環境中反應的真實機器人,這個設計比單純堆參數更實用。對機器人產品化來說,推論架構的改進往往比模型本身更關鍵:決策延遲直接決定機器人能否在動態環境中安全工作。

權重、配方與硬體門檻

SmolVLA 的權重以 lerobot/smolvla_base 公開在 Hugging Face Hub,訓練與微調配方全部開源。部署目標橫跨 CPU、MacBook 與單一消費級 GPU,硬體則對應 SO-100/SO-101 機械臂與 LeKiwi 移動底座。硬體門檻的意義在於迭代速度:如果每次微調都需要叢集資源,實驗週期就以週計;跑在一台筆電上,開發者可以在一天內反覆測試資料配方與任務設計,這對研究節奏的影響比任何單項分數都大。

社群的反饋來得很快。有開發者在 X 上回報,用 RTX 2050(4GB 顯示卡)這種入門級 GPU,搭配低成本 Koch 機械臂,只微調 31 次示範就能跑起 SmolVLA,並形容這是「機器人領域的 BERT 時刻」。TechCrunch 引述了這段說法——一次微調只要 31 條示範資料,正是開源權重對研究者與創客的實際意義。

開源機器人生態的競賽

SmolVLA 是 Hugging Face 低成本機器人佈局的一環:LeRobot 生態(2024 年推出)、收購法國新創 Pollen Robotics、加上約 100 美元的 3D 列印機械臂與 LeKiwi。對面站著 NVIDIA 的開源機器人工具,以及 Physical Intelligence、K-Scale Labs、Dyna Robotics、RLWRLD 等公司。

機器人的 VLA 戰場還在早期,但 SmolVLA 展示的路線很清楚:用小模型、便宜硬體和共享資料集,把門檻壓到大學實驗室和創客都願意進場的程度。如果 LLM 社群的飛輪能夠複製,硬體與資料的開源標準化,會比任何單一模型的分數更能決定這個領域的速度。對想進場的團隊,實際的起點已經備齊:一份開源配方、一隻低價機械臂、一台筆電,剩下的差別只在資料與耐心。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵