2026 年 4 月 8 日,Liquid AI 發布 LFM2.5-VL-450M:一個 450M 參數級的視覺語言模型,也是 LFM2-VL-450M 的後繼版本。官方定位是「結構化視覺智慧,從邊緣到雲端」:小到塞進手機與開發板,輸出卻規整到能直接接進應用。
這一代的更新方向很清楚:新增物件偵測(直接輸出偵測框)與函式呼叫兩種生產環境急需的能力,多語言影像理解擴充到 8 種語言,指令遵循分數大幅上揚。權重已放上 Hugging Face,同時提供 LEAP 平台與 Playground 試用。
從 10T 到 28T tokens
最根本的升級在預訓練規模:從前一代的 10T tokens 擴張到 28T tokens,接近三倍。後訓練採用偏好最佳化與強化學習,官方說法是針對「生產環境中的多模態行為」調校。層數、tokenizer 這類架構細節並未披露,但路線延續該公司一貫的主張:為邊緣裝置的記憶體與延遲限制而設計,而不是先把模型做大再說。
對下游團隊的意義:資料量翻了近三倍、參數級不變,等於把每參數品質往上推——這是邊緣部署唯一能走的路。
新能力:偵測框與函式呼叫
前一代 LFM2-VL-450M 不支援物件偵測;這一代在 RefCOCO-M 上拿到 81.28 分,可以對影像中的指定物件輸出偵測框。函式呼叫(文字模式)在 BFCLv4 上拿到 21.08 分——數字不高,但 450M 級模型能穩定輸出可用的工具呼叫結構,已是入場券。
多語言影像理解覆蓋 8 種語言:阿拉伯文、中文、法文、德文、日文、韓文、葡萄牙文、西班牙文。搭配偵測框,典型場景是「看圖→定位→觸發動作」的邊緣代理流程。
邊緣延遲實測
官方公布 Q4_0 量化後的實測延遲。在 NVIDIA Jetson Orin 上,256×256 解析度每幀 233 毫秒、512×512 每幀 242 毫秒——快到足以處理 4 FPS 影像串流的每一幀。在 Samsung S25 Ultra 手機上分別是 950 毫秒與 2.4 秒;在 AMD Ryzen AI Max+ 395 上是 637 毫秒與 944 毫秒。
這組數字把手機上跑視覺語言模型從展示品推向可用區間:秒級回應的影像問答、端上文件掃描、品檢輔助,都不必再經雲端往返。
進步與退步並存
與前一代相比,多數基準明顯上升:MMStar 43.00 對 40.87、RealWorldQA 58.43 對 52.03、MMBench(dev en)60.91 對 56.27、MMVet 41.10 對 33.85、OCRBench 684 對 657。指令遵循的進步最突出:MM-IFEval 從 33.09 升到 45.00、IFEval 從 51.75 升到 61.16。多語言基準 MMMB 從 54.29 升到 68.09,CountBench 從 47.64 升到 73.31。
但也有退步:MMMU 從 34.44 降到 32.67,InfoVQA 從 44.56 降到 43.02。另外要注意量測口徑——視覺分數用 VLMEvalKit 量測,多語言 MMMB 則以 GPT-4.1-mini 產生的翻譯版本評估,跨基準比較時應抱持一點保留態度。
小模型的務實路線
2026 年的前沿競賽多半在比參數與算力,Liquid AI 選的是另一條:把可用性做進 450M 參數裡。這與我們年初在開年展望中看到的分流一致——一部分廠商衝前沿,另一部分把模型塞進裝置。對隱私敏感、離線優先或延遲敏感的產品,本地視覺模型的吸引力只會上升。
落地路徑完整:從 Hugging Face 下載權重自行部署,或走 LEAP 託管;官方文件還附了衛星影像 VLM 的微調範例。想驗證邊緣 VLM 夠不夠用的團隊,這是成本極低的試點對象。
參考來源
- LFM2.5-VL-450M: Structured Visual Intelligence, Edge to Cloud — Liquid AI
- LiquidAI/LFM2.5-VL-450M — Hugging Face
- Satellite VLM fine-tuning example — Liquid AI Docs
本文由 AI 協助自上述來源整理,經人工審核後發布。
