2026 年 3 月 10 日,總部位於 Palo Alto 的 Rhoda AI 結束 18 個月的隱身期正式亮相,同時宣布兩件事:一輪 4.5 億美元的 A 輪募資(Reuters 與 Bloomberg 報導估值達 17 億美元),以及名為 FutureVision 的機器人基礎模型。資金來自 Capricorn、Khosla Ventures、Leitmotif、Matter Venture Partners、Mayfield、Premji Invest、Prelude Ventures、Temasek、Xora,個人投資者包含 John Doerr。
時間點本身就值得注意:這筆錢落在 Nscale 創下歐洲史上最大輪紀錄的隔天(見〈Nscale 20 億美元 C 輪〉),方向卻完全相反——一邊是算力基礎設施,一邊是把基礎模型裝進機器人的「智慧層」。
創投為何一輪砸下 4.5 億美元
團隊名單是說服力的一部分。共同創辦人暨 CEO Jagdeep Singh 是連續深度科技創業者;首席科學家 Eric Ryan Chan 是 Stanford 電腦視覺研究者,曾任 WorldLabs 的生成模型架構師;共同創辦人 Gordon Wetzstein 主持 Stanford 計算成像實驗室。
但真正讓 A 輪長到 4.5 億美元的,是任務本身的規模:團隊要建立的是跨機體的機器人基礎模型,而非單一機型的控制軟體。Premji Invest 的 Patnam 把投資邏輯說得很白:這類模型能「啟動一個強大的資料飛輪,在捕捉真實世界長尾邊角案例上形成複利優勢」。
FutureVision:從影片預測動作
FutureVision 的核心是 Rhoda 稱為 Direct Video Action(DVA)的專有架構。訓練分兩個階段:先用數億支公開網路影片預訓練,讓模型學會運動與物理先驗;再用較小的機器人資料集後訓練,把影片預測映射成具體動作。
運作時它走閉環:以幾百毫秒為週期觀察、把未來狀態預測成影片、執行動作、再觀察。這直接繼承「世界模型」派的路線——模型先理解場景會怎麼演化,再決定怎麼動。上線一項新任務約需十小時的遙操作資料,對比傳統機器人的客製工程是數量級的改善。
從網路影片到工廠產線
Rhoda 的落地場景務實:製造與物流。新聞稿引用一次高產量製造評估,某項零組件處理任務在無人介入下每週期跑進兩分鐘內,並超過客戶 KPI。Leitmotif 的 Wiese 為客戶端視角下註腳:「真正的挑戰不是解出一次,而是在真實產線條件下持續交付一致、可靠的輸出。」
商業模式上,Rhoda 目前與工業夥伴共同部署,長期則計畫把 FutureVision 授權給其他硬體與軟體平台——賣「機器人大腦」而非整機。
資料飛輪才是賭注
把三個事實並列,就能看出投資人真正買的是什麼:預訓練材料是公開網路影片(取得成本趨近於零)、後訓練只需十小時級的遙操作資料、而每次工廠部署都在生產別人拿不到的專有機器人資料。飛輪每轉一圈,都在降低新任務的進入成本。
對機器人開發者的意義
三個實際啟示。第一,「機器人基礎模型」正在成為可授權的採購項——做特定機體或垂直場景的團隊,競爭問題將是「用誰的智慧層」,而非「要不要自建」。第二,影片預訓練加少量遙操作的配方已被市場多次驗證,新團隊的差異化應放在資料與場景,而非從零重造預訓練。第三,閉環控制對延遲敏感(幾百毫秒週期),邊緣部署與推論成本是工程硬限制,選型時要把供應商的邊緣策略算進去。
參考來源
- Rhoda AI 公開募資與 FutureVision 發表 — Rhoda AI
- Rhoda AI raises $450 million, unveils robot intelligence — Reuters
- AI robotics startup Rhoda valued at $1.7 billion — Bloomberg
本文由 AI 協助自上述來源整理,經人工審核後發布。
