2026 年 8 月 4 日,DARPA 與美國空軍交出一個明確的里程碑:一架 F-16 戰鬥機在完整的 AI 控制下飛行。測試地點在 Eglin 空軍基地,屬於 VENOM 計畫(Viper Experimentation and Next-gen Operations Model)的一環。
機上仍有飛行員,但角色被重新定義:human-on-the-loop 的安全飛行員,負責監看而非操縱。這個細節,是整個故事的核心。
VENOM 是什麼
VENOM 的 F-16 是改裝過的測試平台,任務不是打造單一一款自駕戰機,而是支撐 DARPA 的 AIR 計畫(AI Reinforcements):在真實飛行中評測多個 AI agents 的表現。換句話說,這支機隊是一座飛在天上的評測場——每一次起降產生的數據,都是下一輪篩選 AI agents 的依據。
Human-on-the-loop 的關鍵差異
在自主系統的監督光譜裡,human-in-the-loop 表示每個關鍵決策都需要人核准;human-on-the-loop 則是人監看、可隨時介入,但機器連續自主行動。對戰鬥機這種以秒計的反應環境,後者是唯一說得通的設計。它同時代表信任的單位被改寫:從「相信每一次動作」,變成「相信整個系統的可靠度」。安全飛行員存在的目的,不是接管操縱桿,而是在系統超出邊界時畫下紅線。
把真實飛行當成評測環境
AI 評測長期受限於模擬環境與靜態 benchmark,而模擬與真實世界之間總有落差——空氣動力、硬體回應、突發狀況,都很難完整建模。VENOM 的價值在於把評測搬到實機:
- 多個 AI agents 在同一個真實環境中受測,比的是實際表現,而不是各自回報的 benchmark 分數
- 安全飛行員同步驗證人機介面與介入程序是否真的可用
- 在實機上發現失敗模式的成本很高,但發現到的失敗也最真實
對自主系統領域的意義
這次里程碑的產業讀法:agentic AI 正在進入安全關鍵的實體領域。軟體 agent 出錯可以重來,飛行中的 F-16 沒有重來這個選項。當 DARPA 願意讓 AI 全權控制一架現役戰機,背後代表的評測與驗證方法論,已經累積到一定的信心水位。這套「在真實環境中並行評測多個 AI agents」的思路,對機器人、無人機與工業自動化團隊都是可以直接借鑑的框架——先讓多個候選系統在同一個真實場域競爭,再用數據篩選,而不是先押注單一系統再祈禱它上線後夠穩。
參考來源
- AI-controlled F-16 begins autonomous flight testing for DARPA — Military Embedded Systems
- New test campaign will put AI pilots in most realistic flight conditions yet — Aerospace America
本文由 AI 協助自上述來源整理,經人工審核後發布。
