Video Generation

Runway「The Turing Reel」實測:僅 9.5% 的人能穩定看穿 AI 影片

Runway 用 Gen-4.5 生成影片與真實素材做對照測試,1,043 位受測者的整體正確率只有 57.1%,僅 9.5% 達統計顯著。本文解析測試方法、錯誤分佈,以及為何 Runway 呼籲放棄肉眼偵測、改走 C2PA 溯源路線。

Runway「The Turing Reel」實測:僅 9.5% 的人能穩定看穿 AI 影片 — 文章封面
本頁內容6 個段落
  1. 測試怎麼做
  2. 57.1%:只比丟硬幣好一點
  3. 人類還有優勢的地方
  4. 連 Runway 共同創辦人也分不出來
  5. 從偵測轉向溯源
  6. 參考來源

2026 年 1 月 22 日,Runway 發布「The Turing Reel」研究:以隨機抽樣招募的 1,043 位受測者,每人觀看 20 支 5 秒短片——10 支是真實素材、10 支由最新模型 Gen-4.5 生成——再逐支判斷真假。結果:整體正確率 57.1%,只有 99 人(9.5%)達到統計顯著水準。研究名稱向圖靈測試致意,結論卻近乎反向宣告:在影片這個介面上,人類已經輸掉了這場測試。

這是影片模型廠商第一次用自家最新模型做嚴謹的對照實驗,把「肉眼還能不能偵測 AI 影片」量化到個位數。對平台與內容團隊來說,它不是行銷素材,而是一份該寫進風險評估的數據。

測試怎麼做

  • 真實影片取自 Filmpac 素材庫,涵蓋臉部、全身動作、動物、自然場景與城市環境五類
  • 每支真實影片抽出第一格,餵給 Gen-4.5 新推出的 image-to-video 功能,使用預設參數、只生成一次、不做任何後製
  • 所有影片裁成 5 秒、解析度統一;受測者每支最多看 10 秒就必須判斷
  • 20 支影片隨機排序,真假各半

這個設計刻意貼近社群媒體的觀看情境:短片、快節奏、幾秒內下判斷。換句話說,它測的不是實驗室裡的從容鑑識,而是滑手機時的真實注意力。

57.1%:只比丟硬幣好一點

57.1% 的整體正確率只比 50% 的隨機基準高一點。更關鍵的細節是:受測者判斷真實影片的正確率為 58.0%,判斷生成影片為 56.1%,兩邊差距極小,代表沒有人形成穩定的偵測策略。若把門檻提高到統計顯著(20 題至少答對 15 題,p 值小於 0.05),1,043 人中只剩 99 人過關。TechRadar 的報導直接下結論:多數人已無法把 AI 影片從現實中分出來。

人類還有優勢的地方

分項數據顯示,涉及人的內容表現最好:臉部、手部與人類動作的辨識率達 58–65%,身體結構與物理動作仍是生成模型最常出錯的地方。但動物與建築場景掉到 45–47%,低於隨機猜測——受測者自認的「AI 感」在非人物內容上反而是負向指標。TechRadar 並引述 Gen-4.5 仍存在的破綻:物件消失、因果錯誤(門在把手轉動前就打開)、以及「成功偏誤」(踢歪的球仍然進門)。問題是,這些線索在 5 秒內根本來不及找。

連 Runway 共同創辦人也分不出來

Runway 共同創辦人暨 CTO Anastasis Germanidis 承認,他自己測也「錯了不少」。他的結論值得直接引用:到了這個時間點,我們正在跨過門檻,生成與真實影片已經很難區分,大眾需要對線上內容保持更有批判性的心態。模型公司的技術長親口承認分不出自家產品,比任何 benchmark 分數都更有說服力。

從偵測轉向溯源

研究的最後一部分才是重點:既然肉眼偵測已不可行,內容信任就必須改由源頭證明建立。Runway 已預設在輸出嵌入 C2PA 溯源 metadata、持續開發更可靠的浮水印,並呼籲產業一起建立驗證標準;研究頁面也開放了大眾版的「Real or AI」測試。研究發布後,合成媒體專家 Henry Ajder 等評論者聚焦在低於一成的可靠辨識率,把它視為肉眼偵測時代終結的量化證據。對開發者的啟示很實際:真偽防線應該建在 metadata 與數位簽章這一層,而不是期待使用者或審核人員看得出來。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵