← 所有主題

Multimodal AI

此主題的繁體中文文章,最新優先。

24 篇文章
繁體中文

2026

24 篇文章

  1. Meta

    Muse Spark 把「想久一點」變成可調參數:多代理推理與思考時間懲罰的取捨

    Meta 發表 Muse Spark,以思考時間懲罰與多代理並行推理控制延遲,並開放 meta.ai 與私有 API 預覽。

    閱讀文章 ↗

  2. AI

    把視覺模型塞進輪椅之後:RAMMP 專案揭露的邊緣部署取捨

    Meta 的 DINO 與 SAM 被用於匹茲堡大學 RAMMP 輔助行動平台,重點不是模型多強,而是邊緣裝置上的精度與即時性取捨。

    閱讀文章 ↗

  3. AI

    AMIE 的下一步:AI 醫療從文字走向即時視訊問診

    Google Research 與 Google DeepMind 在 2026 年 8 月發表 AMIE 的視訊問診研究,展示 AI 如何透過多代理架構理解視覺與聽覺線索。本文從產品建造者角度,拆解這項技術對醫療 AI 產品設計的啟示與限制。

    閱讀文章 ↗

  4. Open Models

    MiniMax H3 開源:一次生成 2K 影片與立體聲的全模態模型

    MiniMax 於 7 月 31 日發表 Hailuo 後繼者 H3,數日後釋出權重:33B 全模態 Transformer 同時生成最長 15 秒、768p 起步 2K 的影片與原生立體聲,ComfyUI Day-0 支援,量化後 RTX 3060 也能本地運行。

    閱讀文章 ↗

  5. Video Generation

    Seedance 2.5 登場:30 秒一鏡到底,一次參考 30 張圖與 10 段音訊

    ByteDance Seed 團隊 7 月 31 日發表影片生成模型 Seedance 2.5:單次生成 30 秒、可多輪延伸成多分鐘成片,一次可引用 30 張圖、10 段影片與 10 段音訊,已上架即夢與豆包。

    閱讀文章 ↗

  6. Generative AI

    FLUX 3 登場:影片、圖像、聲音一個骨幹全包

    Black Forest Labs 發表多模態基礎模型 FLUX 3:最長 20 秒含原生音訊的影片生成、多語言文字渲染,並推出以 FLUX 3 為骨幹的機器人動作模型 FLUX-mimic。

    閱讀文章 ↗

  7. Kimi K3

    Kimi K3 登場:2.8T 參數、百萬 Token Context,開源模型走向長程 Agent

    Moonshot 發布 Kimi K3:2.8T 參數的開源 3T 級模型,原生視覺、1M token context,主打長程 coding 與知識工作。本文整理 Delta Attention 架構、kernel 編譯器與晶片設計等案例、API 定價與 64 卡部署建議,以及官方自認仍落後 Fable 5 與 GPT 5.6 Sol 的誠實定位。

    閱讀文章 ↗

  8. Google DeepMind

    DeepMind GenCeption:影片生成模型就是通用視覺學習器

    Google DeepMind 提出 GenCeption,把文字轉影片擴散模型改造成可用文字指令驅動的通用前饋感知模型,在深度、分割、相機姿態等任務達到 SOTA,所需訓練數據最多減少 500 倍。

    閱讀文章 ↗

  9. Meta

    Meta Brain2Qwerty v2:腦波轉文字達 61%

    Meta 發表 Brain2Qwerty v2:以腦磁圖搭配端到端深度學習與微調語言模型,將非侵入式腦波解碼文字的字準確率從過去的 8% 推升至 61%,並開源 v1 與 v2 的訓練程式碼。

    閱讀文章 ↗

  10. OpenRouter

    OpenRouter Unified Image API:統一請求之前,先讓程式看得懂模型差異

    OpenRouter 推出專屬 Image API:單一請求格式接 30 多個模型,能力、參數與計價全部變成可查詢的 schema。本文整理 capability descriptors、三種計費單位、streaming 支援,以及官方的 migration 建議。

    閱讀文章 ↗

  11. AI

    Snap Specs 開賣:2,195 美元的 on-device AR 眼鏡豪賭

    2026 年 6 月 16 日,Snap 正式發表 Specs AR 眼鏡:2,195 美元、雙 Snapdragon 處理器、51 度視野、運算全在眼鏡上完成。本文整理規格與情境式 AI 功能,並看發表後股價下跌逾 5% 的市場反應。

    閱讀文章 ↗

  12. AI

    WWDC26:Siri AI 改版、新一代 Apple Intelligence 與 iOS 27 一次揭曉

    2026 年 6 月 8 日,Apple 在 WWDC26 主題演講發表 Siri AI 改版、新一代 Apple Intelligence 與 iOS 27。本文看蘋果 AI 的更新節奏、助理路線的產品邏輯,與對使用者的實際意義。

    閱讀文章 ↗

  13. Multimodal AI

    Thinking Machines 互動模型:把即時對話訓練進模型本體

    Thinking Machines Lab 發表「互動模型」研究預覽:276B 參數 MoE、12B 啟動,以 200 毫秒微回合實現全雙工語音視訊互動,FD-bench 77.8 領先 GPT-realtime-2.0 與 Gemini Live,並由背景模型補足推理與工具呼叫。

    閱讀文章 ↗

  14. Gemini

    Google Health Coach 5 月 19 日登場:Gemini 教練與 Fitbit 品牌重生

    Google 宣布 Gemini 驅動的 Health Coach 於 2026 年 5 月 19 日全球上線,Fitbit 應用同步更名 Google Health,Health Premium 每月 9.99 美元,AI Pro 與 Ultra 訂戶免費使用,無螢幕手環 Fitbit Air 同日開賣。

    閱讀文章 ↗

  15. Copilot

    微軟 MAI 三模型上線 Foundry:轉錄、語音與影像

    2026 年 4 月 2 日,微軟把自研的 MAI-Transcribe-1、MAI-Voice-1、MAI-Image-2 送上 Microsoft Foundry 公開預覽:轉錄 GPU 成本砍半、一秒生成一分鐘語音、影像模型首發衝上 Arena.ai 第三名。

    閱讀文章 ↗

  16. Qwen

    Qwen3.5-Omni 登場:原生全模態、聽 113 種語言、說 36 種

    阿里巴巴 Qwen 團隊推出原生全模態模型 Qwen3.5-Omni,單一管線處理文字、影像、音訊與視訊並即時說話,256K 上下文、可聽逾 10 小時音訊,Plus 版宣稱在一般音訊任務超越 Gemini 3.1 Pro。

    閱讀文章 ↗

  17. Gemini

    Gemini Embedding 2 公開預覽:文字、影像、音訊、影片共用一個向量空間

    Google DeepMind 於 2026 年 3 月 10 日推出 Gemini Embedding 2 公開預覽:第一個原生多模態嵌入模型,把文字、影像、影片、音訊與 PDF 映射到單一 3072 維向量空間,支援 Matryoshka 截斷。本文解析輸入限制、成本槓桿與對 RAG 管線的實際影響。

    閱讀文章 ↗

  18. Machine Learning

    World Labs 募資 10 億美元:李飛飛的空間智慧賭注升級

    2026 年 2 月 18 日,李飛飛創辦的 World Labs 宣布募資 10 億美元,NVIDIA、AMD、Autodesk、Fidelity 等參投,Reuters 報導估值約 50 億美元。資金將投入世界模型與 Marble 3D 生成產品,把「空間智慧」從研究概念推向可出貨的產品線。

    閱讀文章 ↗

  19. Video Generation

    ByteDance Seedance 2.0 登場:音視訊統一生成,15 秒多鏡頭立體聲

    2026 年 2 月 12 日,ByteDance Seed 團隊發布 Seedance 2.0,以統一多模態架構一次生成 15 秒多鏡頭影片與同步立體聲音軌,支援文字、圖片、音訊、影片四種輸入混合,先在中國上線,再經第三方平台走向海外。

    閱讀文章 ↗

  20. Google DeepMind

    Google Project Genie 上線:世界模型即時生成可玩世界,遊戲股應聲重挫

    Google 於 1 月 29 日向 AI Ultra 訂閱者開放 Project Genie,首個基於 Genie 3 世界模型的公開產品,可從文字與圖片即時生成可互動 3D 世界。次日 Unity 一度暴跌近 24%,遊戲股全面下挫。

    閱讀文章 ↗

  21. Meta

    Meta 超級智能實驗室半年交出首批模型:Bosworth 的達沃斯進度報告

    2026 年 1 月 21 日,Meta CTO Bosworth 在達沃斯證實,重組後的超級智能實驗室已於本月內部交付首批模型,評價「非常好」,但後訓練仍有大量工作。本文整理記者會要點、眼鏡與神經腕帶的載具策略,以及對 2026–2027 消費 AI 定型期的判斷。

    閱讀文章 ↗

  22. AI API

    Deepgram 募得 1.3 億美元、估值 13 億,收購 OfOne 進軍語音點餐

    2026 年 1 月 13 日,語音 AI 公司 Deepgram 以 13 億美元估值完成 1.3 億美元 C 輪,AVP 領投,並收購 YC 培育的 OfOne。現金流已轉正的公司為何募資?語音 API 市場的競局又將如何變化?

    閱讀文章 ↗

  23. Google DeepMind

    Boston Dynamics 量產版 Atlas 現身 CES:全電動人形機器人開始出貨

    CES 2026 上 Boston Dynamics 發表全電動量產版 Atlas:56 自由度、可舉 50 公斤、自主換電池,2026 年部署名額全數給了現代汽車與 Google DeepMind,2027 年初才開放外部客戶。人形機器人從示範影片走進工廠。

    閱讀文章 ↗

  24. AI

    CES 2026 人形機器人日:Atlas 首度公開亮相與量產時間表

    CES 2026 展場首日,Boston Dynamics 首度公開展示 Atlas,Hyundai 規劃數萬台工廠部署,Qualcomm 推出 Dragonwing IQ10,Mobileye 以 9 億美元收購 Mentee。人形機器人從展示走向部署,本文整理關鍵事實與現實檢查。

    閱讀文章 ↗