Meta

Meta 開源 TRIBE v2:預測大腦如何回應影像、聲音與語言

Meta FAIR 釋出 TRIBE v2,以 700 多名受試者的 fMRI 資料訓練,能 zero-shot 預測新受試者、新語言與新任務的大腦反應,解析度較同類模型高約 70 倍,模型、程式碼與展示皆以 CC BY-NC 4.0 釋出。

Meta 開源 TRIBE v2:預測大腦如何回應影像、聲音與語言 — 文章封面
本頁內容6 個段落
  1. TRIBE v2 是什麼
  2. 700 多人、三種模態的訓練基礎
  3. Zero-shot 預測與 70 倍解析度
  4. 釋出內容與授權限制
  5. 體外神經科學能做什麼
  6. 參考來源

Meta 的 FAIR 團隊在 3 月 26 日釋出 TRIBE v2,一個預測人類大腦活動的基礎模型:給它影片、聲音或文字,它輸出的是 fMRI 腦區反應的預測值。模型以 700 多名健康受試者的腦造影資料訓練,能在完全沒見過的新受試者、新語言與新任務上做 zero-shot 預測,解析度比同類模型高約 70 倍。模型權重、訓練與評估程式碼、論文與線上展示全數公開。

對 AI 研究者與神經科學家來說,這是把「體外神經科學」(in-silico neuroscience)往前推了一步:想驗證某個假說,不必再排隊約 fMRI、招募受試者,先在模型上跑一遍模擬。Meta 稱它為神經活動的「數位孿生」。

TRIBE v2 是什麼

TRIBE 的全名是 TRansformer for In-silico Brain Experiments。它是一個三模態編碼模型:把最先進的文字、語音與影像編碼器整合進單一 Transformer,再將多模態特徵映射到腦皮質表面,預測觀看電影、聆聽 podcast 或閱讀文字時的大腦反應,焦點集中在腹側視覺流與聽覺流。

它的前身的確小得多:得獎的 Algonauts 2025 版本只用四個人解析度偏低的 fMRI 訓練。v2 是把同一條技術路線放大到基礎模型的規模——先吞下大量受試者與刺激材料,再對任意新輸入做預測。

700 多人、三種模態的訓練基礎

訓練資料來自 700 多名健康受試者,刺激材料橫跨影像、podcast、影片與文字——也就是視覺、聽覺與語言三個模態的自然材料,而非實驗室裡的人工刺激。這個量級是 zero-shot 能力的前提:模型見過夠多「人與刺激」的組合,才有辦法對沒見過的人直接預測。

技術細節上也做了務實的取捨。預測輸出在 fsaverage5 標準腦網格上(約 2 萬個頂點),並統一往回平移 5 秒以補償血氧動力學的延遲。換句話說,它預測的是「平均大腦」的反應模式,而非個人的完整神經活動。

Zero-shot 預測與 70 倍解析度

兩個數字值得記。第一,解析度較同類模型提升約 70 倍,這讓模型能區分更細微的神經差異,而不是只給粗略的腦區激活。第二,zero-shot:對沒參與訓練的新受試者、新語言、新任務,不需要重新訓練或重新校正就能直接預測。Meta 的報告稱它在各項設定下持續優於標準建模方法。

對研究者而言,zero-shot 才是分水嶺。過去的腦編碼模型多半每換一個實驗就要重訓;能直接套用到新人的模型,才談得上當「模擬器」使用。

釋出內容與授權限制

這次的釋出相當完整:Hugging Face 上的模型權重(facebook/tribev2)、GitHub 上的訓練與評估程式碼(facebookresearch/tribev2)、arXiv 論文,以及 aidemos.atmeta.com 上的互動展示與 Colab notebook。授權是 CC BY-NC 4.0——可自由研究與重製,但禁止商業使用。

授權條款值得注意:這是研究工具的釋出,不是產品級的開放權重。想把它包進商業神經介面或注意力監測產品的團隊,需要另外談授權。

體外神經科學能做什麼

Meta 列出的應用方向有三類。其一是讓神經科學家與臨床研究者在不掃描人類受試者的情況下測試假說,用計算模擬加速研究時程;其二是把大腦的運作原理回頭用來改進 AI 系統;其三是針對影響數億人的神經疾病,用模擬縮短治療研究的迭代週期。NeuroscienceNews 的報導也點出它對腦機介面與失語症等研究的潛在價值。

同時要畫清界線:TRIBE v2 做的是編碼(預測大腦對輸入的反應),不是解碼私人思緒。它回答的是「看這段影片時,聽覺皮質大概會如何反應」,而不是「這個人在想什麼」。這條界線,是這類模型在倫理討論上能否站得住的關鍵。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

這篇內容對你有幫助嗎?

支持本站繼續整理實用的 AI 文章、教學與開發筆記。

請我喝杯咖啡
分享X電郵