Black Forest Labs 在 7 月 23 日發表 FLUX 3,第一個從頭建構在自家「Self-Flow」方法上的多模態基礎模型,現已進入 Early Access。它的核心主張是:影片、圖像與聲音都是「同一個底層世界的投影」,與其分成三個任務各自訓練,不如讓一個架構同時學會生成與理解,把每種模態都當成認識世界的證據。
同一天發表的第二篇文章更值得注意:以 FLUX 3 為骨幹的視覺動作模型 FLUX-mimic,已經在 Audi 的產線上做真實工作。生成式模型公司跨進機器人控制,這條線比任何基準分數都更值得追蹤。
一個骨幹,三種模態:Self-Flow 的賭注
FLUX 3 以數千萬小時的一般影片加上操作類影片訓練,其中影片預測吃掉了超過 95% 的訓練算力。Self-Flow 的做法是在單一架構裡同時對齊多模態生成與理解。有個細節能說明這個賭注的代價:訓練中加入動作預測時,影片品質一度下滑最多 10%,但在 3,500 個訓練步後完全恢復——證明同一個骨幹可以同時勝任內容生成與機器人控制兩種工作。
影片能力與初步基準
影片是這次的主角:最長 20 秒、含原生音訊的片段,涵蓋文字生影片、圖片生影片(動畫化或參考圖驅動)、帶角色延續的影片生影片、關鍵幀轉場、多語言對白、Agentic 多鏡頭串接,以及足以做動態設計的文字排版。圖像方面則有跨風格與解析度的合成與編輯,複雜提示的處理與多語言文字渲染都改善了。
基準數字要先說明是初步結果:以 10 秒 720p 含音訊的文字生影片做人工偏好比較,FLUX 3 以 77% 勝過 Runway Gen-4.5、93% 勝過 Luma Ray 3.2、最高 69% 勝過 Grok Imagine Video、60% 勝過 Kling v3 Pro,對 Seedance 2.0 與 Gemini Omni Flash 則是 52%。
FLUX-mimic:會懂物理的模型去操作機器人
FLUX-mimic 是 Black Forest Labs 與機器人公司 mimic robotics 的合作成果:在 FLUX 3 骨幹上接一個輕量動作解碼器,直接從模型生成影片所用的世界表徵裡讀出機器人動作。邏輯是能生成逼真影片的模型,必然已經學會接觸、運動、重量與因果,這些理解可以直接拿來控制機器人。
實測數據:骨幹在一張 RTX 5090 上以低於 80 毫秒運行,整個系統反應時間 101 毫秒;在凍結骨幹的條件下仍勝過既有的視覺語言動作模型,需要的示範資料也少得多,還能在沒被教過的情況下自行從失敗抓取中恢復。Audi 已在產線測試零件入盒、電子控制單元組裝,以及軟性材料如密封條與線纜的操作,並稱這類軟體操縱是傳統機器人辦不到的工作。
取得方式:Early Access、API 與開放權重
FLUX 3 Video 已開放 Early Access,圖像版預計在幾週後跟進。發布計畫包含影片與圖像的 API 及私有權重、從 mimic robotics 開始的動作能力夥伴存取,以及一個開放權重的「FLUX 3 Dev」骨幹。對習慣在自己機器上跑權重的開發者來說,最後這一項是最重要的承諾。
對創作者與工程團隊的意義
對創作者,實際的改變是音訊原生影片加上可用的文字排版與多鏡頭控制,後期配音與分鏡的工作量會下降。對工程團隊,Self-Flow 與 FLUX-mimic 指出一條路:與其為影片生成和機器人控制分別維護模型,一個懂物理的視覺骨幹可能兩者兼得。開放權重版本何時釋出、授權條款長什麼樣,會決定這個生態系長得多快。
參考來源
本文由 AI 協助自上述來源整理,經人工審核後發布。
