Moonshot AI

Kimi K2.5 開源釋出:原生視覺加上 Agent Swarm 多代理協作

Moonshot AI 於 2026 年 1 月 27 日發表 Kimi K2.5:MIT 授權的開源 MoE model,具備原生視覺與 Agent Swarm 多代理協作。本文解析它對自架多模態 agent 堆疊與多代理系統生態的意義。

Kimi K2.5 開源釋出:原生視覺加上 Agent Swarm 多代理協作 — 文章封面

2026 年 1 月 27 日,Moonshot AI 發表 Kimi K2.5。規格表上有三個關鍵詞:MIT 授權的開源 model、原生視覺能力、Agent Swarm 多代理協作;架構則採用 MoE(mixture-of-experts)。

開源旗艦不稀奇,但「開源+原生視覺+多代理協作」三件事同時出現在同一個 model 上,值得拆開來看。

MIT 授權與 MoE 架構

MIT 是最寬鬆的常見開源授權:允許商業使用、允許改作、幾乎不附條件。對企業來說,這代表法務端的採用摩擦接近零,不需要逐條談授權例外。MoE 架構則把 model 拆成多個專家網路,每個 token 只激活其中一部分——用較少的計算換取大參數量帶來的能力,這也是近年大型 model 的主流選擇。對自架團隊而言,MoE 的意義很實際:同樣的推理預算,能撐起更大的 model。

原生視覺改變 agent 的輸入介面

多數 agent 工作流至今以文字為主:截圖要先經 OCR、文件要先轉純文字,才能進 model。原生視覺把這條前置管線整條拿掉——model 直接看圖。對 browser agent、文件處理、UI 自動化這類「畫面本身就是資訊」的場景,這是質變:agent 看到的不再是轉譯後的文字殘影,而是畫面本身。轉譯層少一層,資訊就少漏一次,錯誤就少一個來源。

Agent Swarm 的協作想像

Agent Swarm 指的是多個 agent 之間的協調機制:任務拆分、分工執行、結果聚合。與其把所有能力塞進一個巨型 agent,不如讓一群各司其職的 agent 協作——這是 agent 工程近期的明顯趨勢。K2.5 把這種協作能力做進 model 本身,意味著多代理協調不再只靠 orchestration 框架在 model 外拼裝,而是 model 層級的原生支援。框架仍會存在,但分工邊界正在重畫。

自架多模態 agent 堆疊的意義

把三個關鍵詞合起來看:一個可以自由下載、能直接看畫面、又內建多代理協調的 model,讓「完全自架的多模態 agent 系統」從拼裝工程變成有正式支援的路線。對資料不能離開內部環境的團隊,這是新的選項;對 orchestrator 生態,這也是新的壓力——當協調能力往下沉到 model 層,框架的價值必須往更上層找,例如治理、觀測與人機協作介面。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵