Ai2

Ai2 開源 WildDet3D:用單張照片預測 3D 偵測框

Ai2 於 4 月 7 日開源 WildDet3D,從單張 RGB 影像預測物體的 3D 偵測框,支援文字、點擊與 2D 框提示,並同步發布超過 1 百萬張影像、370 萬組驗證標註的資料集,零樣本成績大幅超越先前方法。

Ai2 開源 WildDet3D:用單張照片預測 3D 偵測框 — 文章封面
本頁內容6 個段落
  1. 從一張照片到 3D 偵測框
  2. 三種提示、可選深度
  3. WildDet3D-Data:1 百萬張影像的資料集
  4. 分數:零樣本大幅領先
  5. 開發者可以怎麼用
  6. 參考來源

2026 年 4 月 7 日,Allen Institute for Artificial Intelligence(Ai2)發布開源模型 WildDet3D:給它一張普通的 RGB 照片,它輸出畫面中物體的 3D 偵測框——位置、尺寸與朝向,全部以公制座標呈現。不需要深度感測器,也不需要針對特定相機重新微調。模型、訓練程式碼、資料集與技術報告全部公開。

單目 3D 偵測一直是機器人、AR、空間運算這類應用的剛需,卻長期被專用模型盤據:換一個資料集、換一台相機,就得重來一次。WildDet3D 的企圖是把它做成「開放詞彙、多種提示、跨相機通用」的基礎模型,讓 3D 偵測像 2D 偵測一樣拿來即用。

從一張照片到 3D 偵測框

WildDet3D 由三個部分組成。第一是 2D 偵測器,建立在 SAM3 視覺骨幹之上,接受三種提示:文字查詢、點擊位置、以及既有的 2D 框。第二是幾何模組:凍結的 DINOv2 編碼器加上可訓練的深度解碼器,解碼器以球諧函數編碼相機射線方向,因此省掉傳統的相機標定分支。第三是 3D 偵測頭,用交叉注意力把 2D 偵測結果與深度特徵融合後輸出 3D 框。

訓練成本也壓得很低:整個模型只需要 12 個 epoch,而過去的單目 3D 偵測方法普遍需要 80 到 120 個 epoch。對想用自己的資料微調的團隊來說,這是直接的人力與算力差異。

三種提示、可選深度

使用方式圍繞「提示」設計。你可以用文字指定要找的類別(開放詞彙,不限固定清單)、直接點影像上的位置、或餵入現成的 2D 偵測框,模型都會把結果抬升到 3D。把 2D 框逐一抬升的設計,也讓它順帶支援零樣本 3D 追蹤。

深度是可選項。手上若有 LiDAR、TOF 或立體視覺產生的稀疏深度,模型可以把它納入以提升精度;沒有也能運作,只是分數會低一截。這種「有深度就用、沒有就硬算」的彈性,對邊緣裝置與消費級相機的場景特別實用。

WildDet3D-Data:1 百萬張影像的資料集

同步發布的 WildDet3D-Data 是這次發布案的另一個重點:超過 1 百萬張影像、370 萬組經過驗證的 3D 標註,涵蓋 13,000 個以上的類別,其中 10 萬多張由人工標註。資料來自 COCO、LVIS、Objects365 與 V3Det 等既有影像集,先用五種 3D 估計方法產生候選,再經過視覺語言模型與人工雙重過濾。

3D 標註昂貴是這個領域資料稀缺的主因。用多方法估計加驗證過濾的流水線批量生產「夠準」的標註,是一條務實的擴充路徑,也是其他 3D 任務可以直接借用的方法論。

分數:零樣本大幅領先

在 Omni3D 測試集上,WildDet3D 用文字提示拿到 34.2 AP,比 3D-MOOD 高 5.8;用預測的 2D 框(oracle 設定)拿到 36.4 AP,比 DetAny3D 高 2.0。加入稀疏深度後,兩個數字升至 41.6 與 45.8。

零樣本轉移更明顯。在 Argoverse 2 上拿到 40.3 ODS,先前最佳只有 23.8;在 ScanNet 上 48.9 ODS,比前方法高 17.4。在 Stereo4D 上,無深度時 7.5 AP,換成真實立體深度後跳到 27.7 AP。團隊自建的 WildDet3D-Bench(700 多個類別)上,文字提示 22.6 AP 對比基線的 2.3;罕見類別更出現 47.4 對 2.4 的差距。

開發者可以怎麼用

所有資產都在公開管道上:Hugging Face 有模型合集與資料集,GitHub 有推論程式碼(4 月 21 日更新加入完整訓練程式碼),HF Spaces 上有可直接試玩的展示,甚至有 iOS App 可以用手機鏡頭實測。對做機器人、AR 或空間運算的團隊,這是一套可以直接接進原型、再用自己的場景資料微調的起點——12 個 epoch 的訓練成本,讓「自己微調一版」不再是大事。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵