← 所有主題指南

AI 安全與防護

全站 AI 安全文章總覽:prompt injection 防禦、越獄與事件檢討、供應鏈攻擊解析、guardrails 與企業安全預設。

167 篇文章
繁體中文

主題簡介

這個主題收集全站與 AI 安全相關的文章,範圍橫跨模型安全(越獄、對齊、系統卡的防護設計)與傳統資安在 AI 時代的延伸:prompt injection、供應鏈攻擊、帳戶安全。

取向偏實務:真實事件發生後拆解攻擊鏈與檢討報告;工具層面整理 guardrails 與防禦順序;政策層面追蹤安全法規交給開發者的具體義務。

想建立基本防禦概念,從必讀精選裡的 prompt injection 與多層防護兩篇開始。

必讀精選

6

  1. Prompt Injection

    當網頁開始對你的代理下指令:Prompt Injection 的實務風險與防線

    Prompt Injection 把指令藏進資料裡,讓代理在正常流程中照著執行;本文拆解真實案例與可落地的防禦順序。

    閱讀 ↗

  2. AI Safety

    Anthropic 的 Safeguards 團隊如何為 Claude 建立多層防護

    Anthropic 公開 Safeguards 團隊的運作方式:從政策制定、模型訓練、測試評估到即時偵測,多層次確保 Claude 安全可靠。本文為產品開發者拆解這套防護架構的實際做法與挑戰。

    閱讀 ↗

  3. OpenRouter

    OpenRouter Guardrails:不改 code,在 workspace 層為 Agent 裝上成本與安全閘門

    OpenRouter 推出 workspace 級 Guardrails:預算上限、ZDR、模型限制、prompt injection 防禦與 DLP 五合一,免改程式碼。本文拆解 per-entity 預算疊加、30 條 regex 的出口前攔截、只能更嚴的繼承模型與自動化 API。

    閱讀 ↗

  4. Open Source

    TanStack npm 供應鏈攻擊解析:三個漏洞串出 84 個惡意版本

    2026 年 5 月 11 日,攻擊者利用 pull_request_target、Actions cache 中毒與 OIDC 記憶體竊取,從 TanStack 的合法發佈管線推送 84 個惡意版本,竊取雲端憑證與 SSH 金鑰。本文拆解攻擊鏈與修補對策。

    閱讀 ↗

  5. AI Safety

    從 Claude 越獄事件看 AI 安全:產品開發者的實用啟示

    Anthropic 公開了 Claude 模型未經授權存取真實系統的事件,並分享了安全與對齊的改進措施。本文為產品開發者解析這些事件背後的教訓,以及如何在 AI 工具開發中落實更穩健的安全實踐。

    閱讀 ↗

  6. AI Safety

    AI 令網路攻擊更危險,但現有框架可能看不見

    Anthropic 分析 832 個因惡意網路活動被停用的帳戶,發現 AI 正被用於攻擊鏈的後期階段,令攻擊更自動化,而 MITRE ATT&CK 框架未能完全捕捉這些新行為。

    閱讀 ↗

完整時間線

167 篇文章
展開全部 167 篇文章

2026 / 161 篇

  1. 當掃描器看不見攻擊:Cloudflare 用 ML 拆解店面前的惡意 JavaScript
  2. 當 agent 也能改 production:Cloudflare 把 Workers 權限切到單一資源
  3. Grok 接上 Coinbase:當 agent 能直接動你的交易所帳戶
  4. 當網頁開始對你的代理下指令:Prompt Injection 的實務風險與防線
  5. ZDR 不是隱私萬靈丹:把「零保留」當成可強制執行的路由條件
  6. 當核安遇上分類器:Anthropic 與 NNSA 的合作,對開發者意味著什麼
  7. 當 Claude Code 被拿來勒索:產品開發者該從 Anthropic 8 月威脅報告讀到什麼
  8. Paul Christiano 加入 OpenAI 基金會董事會:安全治理的關鍵信號
  9. AI 代理如何把網路間諜活動從「人為指揮」變成「自主執行」
  10. 從 Claude 濫用案例看 AI 安全:產品開發者該注意的三個訊號
  11. 蒸餾攻擊不是理論:Anthropic 揭露 DeepSeek、Moonshot、MiniMax 的 1,600 萬次提取
  12. 從 Claude 越獄事件看 AI 安全:產品開發者的實用啟示
  13. 當 AI 測試環境意外連上真實網路:Anthropic 三起事件的檢討
  14. Anthropic 與 OpenAI 的州級 AI 安全法案之戰:棘輪式升級 vs 反向聯邦主義
  15. Astra 實測數據拆解:ExploitBench 滿分、兩個零日漏洞,與少用 9% token 的祕密
  16. Fable 5.1 與 Mythos 5.1 同模型:快取讀取降 75%
  17. Cloudflare 聯手 OpenAI Daybreak:用網路脈絡解決漏洞優先順序難題
  18. Gemini 3.8 Flash 價格 2027 年翻倍:Cyber 版 CWE-Bench 47.2%
  19. Meta Muse Spark 1.3:把「會問問題、知道極限」的代理行為當成主打功能
  20. OpenAI 推出 Astra:第一個觸發 Critical 網路門檻的模型如何安全上架
  21. Enterprise Frontier Safeguards:把監控資料留在客戶手上,同時守住前沿模型安全
  22. Fairwind 計劃:Google 如何用 AI 幫政府與企業主動修補漏洞
  23. Adaptive Intelligence:讓每次攻擊都變得不划算
  24. OpenAI 終止向 Cursor 供應模型:開發者與產品決策者的啟示
  25. Model Hardware Standard 研究預覽:讓 AI Agent 安全操作實驗室與工廠設備
  26. Anthropic 推出 2 億美元研究基金,探索 AI 經濟衝擊的應對方案
  27. Anthropic 撥款五百萬美元,資助 AI 對幸福感影響的獨立評估
  28. OAuth 不再全有或全無:Cloudflare 推出可自訂的授權範圍
  29. 零資料保留不讓步:OpenAI 只看訊號,不看內容
  30. Go 1.27 登場:泛型方法、json v2 與後量子加密
  31. AI 如何改變權力平衡:OpenAI 新團隊的長期思考
  32. 看不見的 Agent 流量:Cloudflare 如何偵測 Shadow MCP 並收回治理權
  33. 用 Cloudflare Access 一次點擊,保護所有內部 vibe-coded 應用
  34. Z.ai 發表 GLM-5.3:開源程式碼新高,網路攻擊能力超預期
  35. Docker Sandboxes:用 microVM 給 AI 編碼代理圈出安全區
  36. 偷走 AI 的思考:兩次 API 呼叫還原隱藏推理鏈
  37. Edge 終結 Manifest V2:uBlock Origin 時代收尾
  38. OpenAI 首度無法排除 Astra 達 Critical 網路門檻
  39. Mistral 開源 Shieldstral:把審查政策變成一句提問的 3B 分類器
  40. FFmpeg 9.0「Lei」發布:swscale 重寫與更安全的預設
  41. 第三方資安測試中,模型為何越界?OpenAI 揭露兩起評估事件
  42. Apple 控告 OpenAI:一封寄錯的電郵,與一場被誤解的離職
  43. Chrome 兩個版本修復 1,072 個漏洞:AI 撐起整條資安工具鏈
  44. OpenAI 在歐洲的負責任 AI 實踐:從框架到落地
  45. Dario Amodei 表態:Anthropic 從未主張禁用開放權重模型
  46. 歐盟登記「停止殺死網際網路」倡議:反對強制數位身分與年齡驗證
  47. Claude Mythos 60 小時改寫 HAWK 攻擊
  48. AI 代理逃出評估沙盒入侵 Hugging Face:四天半攻擊的技術時間線
  49. 印度下令 GitHub 下架 Bitchat:藍牙通訊遇上審查
  50. 機場一組密碼清空手機:GrapheneOS 用戶遭聯邦起訴
  51. Claude Opus 4.7 來了:更耐操、更會驗證,但安全閘門也變多了
  52. OpenAI 認了:內部評估模型逃出沙盒,駭進 Hugging Face 作弊
  53. 把 Claude Code 放到備用 Mac:隔離 Agent 工作站的價值與安全界線
  54. Vercel Agent 進入 Production:先調查、再提案,批准後才動手
  55. Anthropic 的 Safeguards 團隊如何為 Claude 建立多層防護
  56. Cognition 推出 Devin Security Swarm:代理群驗證漏洞並自動修補
  57. Claude 3.7 Sonnet 的「延長思考」:可調控的推理預算與可觀察的思考過程
  58. NVIDIA 的硬體級 AI 安全:如何在保護資料的同時不拖慢推論速度
  59. Fable 5 回歸:新分類器擋下 99% 越獄手法
  60. Claude Code 六月底連發:組織預設模型上線、MCP 邊界補強
  61. Cloudflare OAuth 全開放:自助式用戶端與零停機引擎升級
  62. Anthropic 的 Claude Corps:用一年時間,把 AI 技能帶進非營利組織
  63. Gemini 3.5 Flash 內建電腦操作:OSWorld 78.4 追平 Sonnet
  64. Claude 可能要看你的證件:Anthropic 驗證政策與生物特徵爭議
  65. 荷蘭部長親赴華府反對 MATCH 法案:ASML 出口管制之戰升級
  66. Patch the Planet:用 AI 幫開源維護者補洞,而不是增加負擔
  67. MosaicLeaks 基準:研究代理的對外查詢正在洩漏企業機密
  68. Anthropic Project Fetch 第二階段:Opus 4.7 操作機器狗比人快 20 倍
  69. 美國《Great American AI Act》草案:三年預佔州權引爆反彈
  70. MCP 企業託管授權定案:零接觸 OAuth 讓 AI 代理連上企業工具
  71. Vercel 企業版:讓內部 AI Agent 與應用安全上線的四道預設防線
  72. Pramaana Labs 募 2,700 萬美元:用形式化驗證約束 LLM 輸出
  73. OpenAI 遭多州檢察長聯盟調查:傳票直指廣告、諂媚與未成年保護
  74. Anthropic 被要求停用 Fable 5 與 Mythos 5:一次關於監管與 AI 安全的警鐘
  75. 美國人點睇 AI?Anthropic 首份 Public Record 調查的 5 個關鍵發現
  76. xAI 遭前工程師提告:警示 Grok 安全風險反被逼退
  77. Waymo Reference Driver:把謹慎駕駛變成可量測的基準
  78. Apple 拒在歐盟推出 Siri AI:DMA 豁免遭駁回始末
  79. Miasma 蠕蟲再襲 Microsoft:73 個儲存庫停用,AI 編碼代理成靶
  80. xAI 要求法院揭露 Grok 深偽原告身分:匿名訴訟權之戰
  81. AI 令網路攻擊更危險,但現有框架可能看不見
  82. Meta AI 客服機器人成了帳號綁架工具:Instagram 通知受駭用戶
  83. Cyera 傳以 120 億美元估值募資:80 倍 ARR 的資安豪賭
  84. OpenAI 的政治立場:不設 PAC、不捐款,強調透明與直接倡議
  85. OpenRouter Guardrails:不改 code,在 workspace 層為 Agent 裝上成本與安全閘門
  86. Cisco 實測 15 個封閉前沿模型:多輪攻擊無一倖免
  87. Robinhood 開放 AI 代理人代客下單與刷卡消費
  88. 偽裝領域提示注入:讓 LLM 偵測器失效的防護盲區
  89. NHS 畏懼 AI 漏洞挖掘大舉關閉開源庫,GDS 發布指引唱反調
  90. Cisco 裁員近 4,000 人加碼 AI:創紀錄營收下的成本重組
  91. Google 首次截獲 AI 開發的零日攻擊:繞過 2FA 的邏輯漏洞
  92. TanStack npm 供應鏈攻擊解析:三個漏洞串出 84 個惡意版本
  93. Helsing 將以 180 億美元估值募資 12 億:歐洲國防 AI 再創新高
  94. Mini Shai-Hulud 蠕蟲襲捲 npm:連 Mistral SDK 與 SLSA 證明都淪陷
  95. OpenAI 如何安全部署 Codex:從沙箱到代理原生日誌
  96. 賓州起訴 Character.AI:聊天機器人假冒精神科醫師
  97. GPT-5.5 Instant 的系統卡透露了什麼:首次被列為高能力的 Instant 模型
  98. 白宮擬 AI 監管行政命令:模型上市前審查成選項
  99. OpenAI 推出進階帳戶安全:給高風險使用者的防釣魚登入與更嚴格復原機制
  100. 批評 Anthropic 設閘之後,OpenAI 也限制 GPT-5.5-Cyber 存取
  101. Google 開放五角大廈機密網路使用 AI:Anthropic 拒絕後的第三張門票
  102. OpenAI 的「哥布林」之謎:獎勵機制如何悄悄塑造模型行為
  103. OpenAI 取得 FedRAMP Moderate 授權:美國政府採用 AI 的門檻降低
  104. GPT-5.5 系統卡出爐:OpenAI 如何為複雜工作設計更強防護
  105. LMDeploy 視覺語言模組 SSRF 漏洞:揭露 13 小時後即遭利用
  106. Google 掃描公開網路:間接提示注入攻擊正在增長
  107. OpenAI 開源 Privacy Filter:1.5B 參數的 PII 偵測過濾模型
  108. Vercel 資安事件:一個第三方 AI 工具如何外洩客戶資料
  109. 華府催華爾街測試 Anthropic Mythos:訴訟與合作並行的雙軌
  110. Novartis 執行長入董事會:Anthropic 信託任命董事過半
  111. N-Day-Bench:用知識截止後的真實漏洞評測 LLM 安全能力
  112. 中國發布擬人化互動 AI 暫行辦法,AI 伴侶納入強監管
  113. Gartner:2028 年 25% 企業 GenAI 應用每年至少 5 次資安事件
  114. NVD 棄守 CVE 積壓:AI 讓漏洞洪流沖垮人工管線
  115. Anthropic 啟動 Project Glasswing:用 Mythos Preview 獵零日漏洞
  116. Redwood 首席科學家的 AI 現況快照:1.6 倍研發加速與 8% 失準事件機率
  117. Cloudflare Workers 重新檢視遠端 Spectre 攻擊:DyPrIs 的缺口與修補
  118. 聯邦法官暫阻五角大廈將 Anthropic 列為供應鏈風險
  119. OpenAI 推 Safety Bug Bounty:提示注入與 Agent 濫用也能領賞
  120. 桑德斯與 AOC 提出《AI 資料中心暫停法》:防護到位前凍結新建
  121. Accenture 攜手 Anthropic 推出 Cyber.AI:Claude 當資安營運的推理引擎
  122. WHO 專家定調:生成式 AI 的心理健康風險是公共衛生議題
  123. Google RSAC 2026:用 Gemini 情報與 AI Agent 追上 22 秒的攻擊
  124. Visa Agentic Ready 登場:歐洲 21 家發卡行實測 AI 代理付款
  125. 白宮 AI 國家政策框架出爐:一份寫給國會的立法建議書
  126. 5.1 億美元 AI 伺服器走私中國案:美國起訴 Super Micro 相關三人
  127. OpenAI 硬體負責人 Kalinowski 因五角大廈協議辭職
  128. OpenAI 推出 Codex Security 研究 preview:找漏洞也幫你修的資安 agent
  129. 猶他州 AI 處方續領機器人遭越獄:Mindgard 揭 Doctronic 系統提示與知識截止漏洞
  130. 川普下令聯邦機構停用 Anthropic:AI 安全紅線引爆的封殺戰
  131. xAI Grok 打進五角大廈機密系統:接受「一切合法用途」的門票
  132. Anthropic RSP 3.0:拿掉「危險模型自動暫停」承諾
  133. Guide Labs 開源 Steerling-8B:把可解釋性做進模型本身
  134. 微軟媒體真偽藍圖:60 種驗證組合的實戰報告
  135. Firefox 148 的 AI 總開關:可封鎖現有與未來的所有 AI 功能
  136. OpenAI 與 Microsoft 加入英國 AISI 對齊計畫,安全研究資金突破 2,700 萬英鎊
  137. NIST 啟動 AI Agent 標準倡議:互通與安全決定代理普及速度
  138. 歐洲議會封鎖議員公務裝置內建 AI:雲端資料與美國司法風險
  139. ChatGPT 推出 Lockdown Mode 與 Elevated Risk 標示:把注入防禦做成產品功能
  140. 軍事 AI 峰會 85 國僅 35 國簽署:美中雙雙退出宣言
  141. 微軟 Cyber Pulse 報告:八成財星 500 大企業已在跑 AI 代理
  142. UNICEF 呼籲各國將 AI 生成兒童性虐待內容全面入罪
  143. Microsoft 新掃描法:不必知道觸發詞,也能抓出 LLM 裡的臥底後門
  144. Moltbook:AI agent 專屬社群一週 160 萬帳號,資料庫漏洞外洩 150 萬組金鑰
  145. Waymo World Model 登場:用 Genie 3 生成超擬真自駕模擬世界
  146. 聯合國揭曉 AI 科學小組 40 位提名專家:AI 版 IPCC 起步
  147. 國際 AI 安全報告 2026 登場:百位專家點名自主代理風險
  148. 從 Clawdbot 到 OpenClaw:爆紅開源代理一週二改名,安全疑慮升高
  149. 前 Google 工程師因竊取 AI 機密被定罪:美國首宗案件解析
  150. AI 一次找齊 OpenSSL 全部 12 個零日漏洞:資安研究的分水嶺
  151. Meta 全球暫停青少年使用 AI 角色:家長控制版上線前的全面止血
  152. 新加坡率先推出 Agentic AI 治理框架:四道防線框住自主代理人
  153. Anthropic 公開 Claude 新憲法:約 80 頁、CC0 授權、走向理由本位的對齊
  154. Claude Code 新增 /security-review 與 GitHub Actions 整合:安全審查走進 agent
  155. CrowdStrike 收購 SGNL:把每個 AI Agent 都當成特權身分來防護
  156. Allianz 攜手 Anthropic:Claude 進駐 15.6 萬人的保險巨頭
  157. 肯塔基州起訴 Character.AI:全美首件州級 AI 聊天機器人訴訟
  158. 韓國 AI 基本法 1 月 22 日生效:全球最早全面實施的 AI 法規
  159. 2026 年 1 月 1 日生效:美國州級 AI 法令的第一波合規壓力
  160. Google AI Overviews 醫療建議出錯:英國慈善團體提出警告
  161. 加州 SB 53 元旦生效:前沿 AI 透明化義務正式上路

2025 / 6 篇

  1. 機器人計程車上路隔天,NHTSA找上特斯拉
  2. 特斯拉機器人計程車上路:奧斯汀邀請制載客營運
  3. 特斯拉機器人計程車週日開跑:邀請制、隨車安全監控員
  4. Anthropic 紅隊報告:16 模型模擬中高比例勒索
  5. OpenAI 預期 o3 後繼模型觸及生物風險高等級
  6. Bengio 創立 LawZero 非營利AI安全實驗室