AI for Science

哈佛急診研究:o1 診斷準確率勝過兩位主治醫師

哈佛醫學院團隊在《Science》發表研究:在 76 名急診患者的檢傷診斷上,o1 以 67% 的精確或接近精確診斷率勝過兩位主治醫師的 55% 與 50%。本文解析數據、批評與落地限制。

哈佛急診研究:o1 診斷準確率勝過兩位主治醫師 — 文章封面
本頁內容6 個段落
  1. 研究怎麼做
  2. 數字背後
  3. 為什麼差距在檢傷階段最大
  4. 批評與限制
  5. 對臨床與產品團隊的意義
  6. 參考來源

2026 年 4 月 30 日,《Science》刊出一項由哈佛醫學院與 Beth Israel Deaconess 醫學中心團隊主持的研究:在急診室的診斷任務上,OpenAI 的 o1 推理模型表現勝過兩位主治醫師。TechCrunch 在 5 月 3 日的報導讓它進入大眾視野。這不是跑分式宣傳:研究用的是真實急診患者的電子病歷,評分者也不知道每個診斷來自人還是模型。對正在評估醫療 AI 落地路徑的團隊,數字值得細讀,限制同樣關鍵。

研究怎麼做

研究由哈佛醫學院 Arjun Manrai(主持一個 AI 實驗室)與 Beth Israel 醫師 Adam Rodman 領銜。團隊找了 76 名到院急診患者,讓 o1、GPT-4o 與兩位內科主治醫師在相同時間點、依據相同的電子病歷資訊給出診斷,再由另外兩位不知道診斷來源的主治醫師盲測評分。資料沒有預先處理,模型看到的就是臨床當下能取得的紀錄。作者宣稱,大型語言模型「已經超越了大多數臨床推理的基準」。

數字背後

在資訊最稀缺的檢傷分類階段,o1 有 67% 的案件給出精確或接近精確的診斷,兩位醫師分別是 55% 與 50%。隨著臨床細節累積,o1 的準確率升到 82%,醫師落在 70% 到 79%——但這個差距不具統計顯著性。真正拉開差距的是治療計畫子研究:在 5 個案例、46 位醫師的對照中,AI 拿到 89%,只能使用常規資源(包括搜尋引擎)的醫師只有 34%。其中一個案例裡,o1 正確把肺栓塞患者惡化的症狀,連結到人類醫師忽略的紅斑性狼瘡病史。

為什麼差距在檢傷階段最大

檢傷是急診資訊最少的時刻:患者剛到院、檢驗結果還沒回來、時間壓力最大。模型在這裡反而相對佔優,原因在於它可以同時權重整份病歷裡的每一條線索,不會因為疲勞或認知偏誤漏掉罕見但關鍵的病史。Rodman 向《衛報》表示,大型語言模型是「數十年來最有影響力的技術之一」,並預期未來會出現「三方照護模式:醫師、病人與人工智慧系統」。Manrai 則說得保守:「我不認為我們的發現代表 AI 取代醫師」,而是「將重塑醫學的重大技術變革」。

批評與限制

急診醫師 Panthagani 的批評最直接:這是「一項有趣、卻帶來大量炒作標題的 AI 研究」。對照組是內科主治醫師,而非急診專科醫師——她指出急診醫師的第一目標不是猜中最終診斷,而是快速排除會致命的病因,兩者的工作定義不同。技術上,模型只吃文字資料,無法評估患者的外觀、痛苦程度與生命徵象以外的臨場線索,作者自己把它比擬為「來自紙本的第二意見」。論文也明說,結論不足以直接用於真實急診決策,需要前瞻性實地試驗。Rodman 另外點出:目前對 AI 診斷「沒有正式的問責框架」,而生死交關的決定,病人仍然希望有人類參與。

對臨床與產品團隊的意義

採用的背景比研究本身更值得注意:美國近五分之一的醫師已經用 AI 輔助診斷,英國有 16% 的醫師每天使用、15% 每週使用。「文件密集、資訊碎片化」的臨床推理,已是消費級模型能自然切入的位置。對產品團隊有三個啟示:第一,檢傷與鑑別診斷是模型最能創造價值的早期接觸點,因為輸入幾乎全是文字;第二,盲測評分與「精確或接近精確」的分級方法,是可以搬進自家評估流程的務實設計;第三,問責與專科匹配是落地前必答的問題——內科醫師當對照組的爭議,就是下版研究設計的教科書案例。AI 已好到值得正式臨床測試,正是論文的核心主張。

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵