2026 年 5 月 27 日,Cisco 的 AI 威脅研究團隊在官方部落格發表研究「Proprietary Problems: No Frontier Model Is Multi-Turn Immune」,針對五家實驗室的 15 個封閉模型,比較單輪與多輪攻擊的成功率。結論寫在標題裡:沒有模型對多輪攻擊免疫,成功率最高衝到 88.30%。
這不是邊角研究。Cisco 是企業資安市場的主要供應商,AI Defense 與 LLM Security 排行榜直接影響企業選型。當它說「單輪分數不能代表安全」,依賴模型卡與公開評測的採購團隊就得重新檢視流程。
測試怎麼做
研究使用同一套框架與題庫:30,090 個單輪提示(每模型 2,006 個),加上 1,456 個對話中的 6,986 次多輪攻擊。對象涵蓋 OpenAI GPT-5.2 與 GPT-5.4 家族、Anthropic Claude Opus 4.5/4.6、Sonnet 4.5/4.6、Haiku 4.5、Google Gemini 3 Pro、Amazon Nova Lite、Nova Micro、Nova 2 Lite,以及 xAI Grok 4.1 Fast 的推理與非推理設定。
這是 2025 年 11 月開放權重研究「Death by a Thousand Prompts」的續篇——該研究發現多輪攻擊對 Mistral Large-2 的成功率高達 92.78%。這次把戰場延伸到封閉模型,結論一致:多輪脆弱性是結構性問題,與開源與否、對齊哲學無關。
五種攻擊策略
多輪攻擊不是把壞問題問很多次,而是把惡意請求拆解、重組、逐步升溫。Cisco 歸納出五個策略家族:角色扮演、語境誤導、拒絕重構、資訊分解重組,以及漸進升級(crescendo)。Cisco 研究負責人 Amy Chang 說得直白:「真實的對手不會在第一次被拒絕後就停下來。」
數字會說話
- 多輪攻擊成功率區間為 7.89% 至 88.30%;單輪只有 2.19% 至 64.91%
- Claude 家族單輪 2.19–3.64%,多輪升至 11.16–16.20%,仍是全場最佳防線
- GPT-5.4 從 2.74% 跳到 24.68%,相差約 9 倍
- Gemini 3 Pro 從 18.10% 漲到 73.35%,暴增逾 55 個百分點
- Grok 4.1 Fast 非推理設定以 88.30% 居冠;開啟推理模式後腰斬至 43.47%
- Amazon Nova 2 Lite 反向:單輪 34.05%,多輪卻是全場最低的 7.89%
過半模型的兩種成績差距逾 15 個百分點,且兩種測法產出不同的排名與失效地圖。Chang 對基準測試的批評一針見血:「單輪基準分數展示的是模型在攻擊者不會使用的情境下的表現。」
設定旗標的隱藏風險
研究最值得警惕的細節是推理模式開關:同一個 Grok 4.1 Fast,切一個設定就讓成功率變動逾 40 個百分點。這種差異不會出現在公開評測或模型卡上,兩個部署「相同模型」的團隊,安全水位可能天差地遠。這也與更大的提示注入版圖互相印證——例如近期以網域偽裝藏身的注入攻擊,同樣繞過靜態防線。
給採購與治理團隊的建議
Cisco 提出三個具體動作:
- 每次模型發布都公布分策略家族的成功率,而非只給總分
- 以前三大失效程序與內容類型做部署閘門,回歸逾 3 個百分點就擋下審查
- 兩種測法差距逾 15 個百分點的模型列入人工審查——這條規則會抓到 15 個模型中的 8 個
NIST AI RMF、草擬中的 NIST IR 8596 與 EU AI Act 第 15 條都要求對抗性測試,但都沒規範「互動輪數」維度。Cisco 的最終訊息很清楚:沒有基礎模型在迭代攻擊下是安全的,防線必須移到模型之外——執行期防護、監控與應用層政策。正如 Chang 所言:「防護欄能降低風險,但不能消除風險。」
參考來源
- Proprietary Problems: No Frontier Model Is Multi-Turn Immune — Cisco
- Frontier AI models collapse under multi-turn AI attacks, Cisco finds — Help Net Security
- Leading AI models are more vulnerable to malicious prompts than vendors claim — Cybersecurity Dive
本文由 AI 協助自上述來源整理,經人工審核後發布。
