2026
8 篇文章當網頁開始對你的代理下指令:Prompt Injection 的實務風險與防線
Prompt Injection 把指令藏進資料裡,讓代理在正常流程中照著執行;本文拆解真實案例與可落地的防禦順序。
閱讀文章 ↗OpenRouter Guardrails:不改 code,在 workspace 層為 Agent 裝上成本與安全閘門
OpenRouter 推出 workspace 級 Guardrails:預算上限、ZDR、模型限制、prompt injection 防禦與 DLP 五合一,免改程式碼。本文拆解 per-entity 預算疊加、30 條 regex 的出口前攔截、只能更嚴的繼承模型與自動化 API。
閱讀文章 ↗Cisco 實測 15 個封閉前沿模型:多輪攻擊無一倖免
2026 年 5 月 27 日,Cisco 發表研究,對 OpenAI、Anthropic、Google、Amazon、xAI 共 15 個封閉模型發動近 7,000 次多輪攻擊,最高成功率達 88.3%,沒有任何模型免疫,連設定旗標都會大幅改變風險。本文解析測試方法、各模型數字與採購建議。
閱讀文章 ↗偽裝領域提示注入:讓 LLM 偵測器失效的防護盲區
arXiv 5 月 21 日論文提出「領域偽裝注入」:模仿文件領域詞彙的注入指令,讓偵測率從 93.8% 跌到 9.7%,Llama Guard 3 全數失守,多代理辯論更將攻擊放大 9.9 倍,凸顯注入偵測的結構性盲區。
閱讀文章 ↗Google 首次截獲 AI 開發的零日攻擊:繞過 2FA 的邏輯漏洞
Google 威脅情報團隊 5 月 12 日報告首度確認:有犯罪集團使用疑似 AI 開發的零日漏洞繞過 2FA,目標是一款開源網管工具,並已策劃大規模濫用。報告同時揭露自我變形惡意軟體與用 Gemini 驅動的 Android 後門。
閱讀文章 ↗Google 掃描公開網路:間接提示注入攻擊正在增長
Google 威脅情資團隊掃描 Common Crawl 網頁快照,首度系統性盤點網路上的間接提示注入:從惡作劇、SEO 操縱到資料外洩樣樣有,惡意案例在 2025 年 11 月至 2026 年 2 月成長 32%。本文解析研究方法與防禦對策。
閱讀文章 ↗猶他州 AI 處方續領機器人遭越獄:Mindgard 揭 Doctronic 系統提示與知識截止漏洞
AI 安全公司 Mindgard 用簡單越獄手法操縱猶他州的 Doctronic 處方續領系統:抽出約 60 頁系統提示、偽造監管文件把 OxyContin 劑量調升三倍,污染更寫進發給醫師的 SOAP 病歷。本文拆解攻擊鏈、揭露時間線與三方回應。
閱讀文章 ↗ChatGPT 推出 Lockdown Mode 與 Elevated Risk 標示:把注入防禦做成產品功能
OpenAI 於 2026 年 2 月 16 日為 ChatGPT 導入 Lockdown Mode 與 Elevated Risk 標示,針對 prompt injection 與資料外洩攻擊提供防禦。當助理開始代理使用者讀網頁、動資料,攻擊面也跟著搬進對話框。
閱讀文章 ↗
2026
7 ARTICLESPrompt Injection Is a Data-Trust Problem, Not a Prompt Problem
Hidden prompts in web pages turn scraped data into instructions, so builders must treat fetched content as untrusted input.
READ POST ↗Cisco Tested 15 Frontier Models: None Survive Multi-Turn
Cisco ran 6,986 multi-turn attacks against 15 closed frontier models from five labs. Multi-turn success hit 88.3% and no model was immune. What the study means for AI buyers.
READ POST ↗Domain-Camouflaged Injections Evade LLM Injection Detectors
A May 21 arXiv paper shows domain-camouflaged prompt injections collapse detector recall from 93.8% to 9.7%, fool Llama Guard 3, and scale 9.9x in multi-agent debate.
READ POST ↗Google Catches the First AI-Developed Zero-Day in the Wild
Google's GTIG reports the first AI-developed zero-day: a 2FA-bypass logic flaw in an open-source sysadmin tool, plus self-morphing malware and a Gemini-driven Android backdoor.
READ POST ↗Google Scanned the Web for Indirect Prompt Injections
Google Threat Intelligence scanned Common Crawl for indirect prompt injections: pranks, SEO manipulation, data exfiltration — malicious cases up 32% since November 2025.
READ POST ↗Mindgard Jailbroke Utah's AI Prescription Refill Bot
Mindgard pulled ~60 pages of system prompts from Utah's Doctronic prescription bot, then used fake regulators to triple OxyContin doses — poison that reached SOAP notes sent to physicians.
READ POST ↗ChatGPT Gets Lockdown Mode and Elevated Risk Labels: Injection Defense as a Product Feature
On February 16, 2026, OpenAI introduced ChatGPT Lockdown Mode and Elevated Risk labels to defend against prompt injection and data-exfiltration attacks. Defense becomes a product feature.
READ POST ↗