← 所有主題指南← ALL TOPIC GUIDES
AI 安全與防護AI Safety & Security
全站 AI 安全文章總覽:prompt injection 防禦、越獄與事件檢討、供應鏈攻擊解析、guardrails 與企業安全預設。Every post here on AI safety and security: prompt injection defenses, jailbreak and incident reviews, supply-chain attack postmortems, guardrails, and enterprise security defaults.
主題簡介ABOUT THIS TOPIC
這個主題收集全站與 AI 安全相關的文章,範圍橫跨模型安全(越獄、對齊、系統卡的防護設計)與傳統資安在 AI 時代的延伸:prompt injection、供應鏈攻擊、帳戶安全。
取向偏實務:真實事件發生後拆解攻擊鏈與檢討報告;工具層面整理 guardrails 與防禦順序;政策層面追蹤安全法規交給開發者的具體義務。
想建立基本防禦概念,從必讀精選裡的 prompt injection 與多層防護兩篇開始。
This hub gathers the AI safety and security coverage on this site, spanning model safety (jailbreaks, alignment, system-card protections) and the extension of classic security into the AI era: prompt injection, supply-chain attacks, and account security.
The angle is practical: postmortems that break down real attack chains, tool-level write-ups of guardrails and defense ordering, and policy tracking focused on what new rules actually require of developers.
To build a baseline, start with the prompt injection and layered-protection picks below.
必讀精選MUST READ
6當網頁開始對你的代理下指令:Prompt Injection 的實務風險與防線
Prompt Injection 把指令藏進資料裡,讓代理在正常流程中照著執行;本文拆解真實案例與可落地的防禦順序。
閱讀 ↗Anthropic 的 Safeguards 團隊如何為 Claude 建立多層防護
Anthropic 公開 Safeguards 團隊的運作方式:從政策制定、模型訓練、測試評估到即時偵測,多層次確保 Claude 安全可靠。本文為產品開發者拆解這套防護架構的實際做法與挑戰。
閱讀 ↗OpenRouter Guardrails:不改 code,在 workspace 層為 Agent 裝上成本與安全閘門
OpenRouter 推出 workspace 級 Guardrails:預算上限、ZDR、模型限制、prompt injection 防禦與 DLP 五合一,免改程式碼。本文拆解 per-entity 預算疊加、30 條 regex 的出口前攔截、只能更嚴的繼承模型與自動化 API。
閱讀 ↗TanStack npm 供應鏈攻擊解析:三個漏洞串出 84 個惡意版本
2026 年 5 月 11 日,攻擊者利用 pull_request_target、Actions cache 中毒與 OIDC 記憶體竊取,從 TanStack 的合法發佈管線推送 84 個惡意版本,竊取雲端憑證與 SSH 金鑰。本文拆解攻擊鏈與修補對策。
閱讀 ↗從 Claude 越獄事件看 AI 安全:產品開發者的實用啟示
Anthropic 公開了 Claude 模型未經授權存取真實系統的事件,並分享了安全與對齊的改進措施。本文為產品開發者解析這些事件背後的教訓,以及如何在 AI 工具開發中落實更穩健的安全實踐。
閱讀 ↗AI 令網路攻擊更危險,但現有框架可能看不見
Anthropic 分析 832 個因惡意網路活動被停用的帳戶,發現 AI 正被用於攻擊鏈的後期階段,令攻擊更自動化,而 MITRE ATT&CK 框架未能完全捕捉這些新行為。
閱讀 ↗
Prompt Injection Is a Data-Trust Problem, Not a Prompt Problem
Hidden prompts in web pages turn scraped data into instructions, so builders must treat fetched content as untrusted input.
READ ↗How Anthropic Builds Multi-Layer Safeguards for Claude: A Blueprint for AI Product Teams
An inside look at Anthropic's Safeguards team: policy, training, testing, real-time detection, and monitoring—and what product builders can learn.
READ ↗OpenRouter Guardrails: Budget and Safety Gates for Agents at the Workspace Layer
OpenRouter Guardrails bundle budget enforcement, ZDR, model limits, prompt injection defense, and DLP into one no-code workspace layer, with per-entity budgets and inheritance that only tightens.
READ ↗Inside the TanStack npm Supply-Chain Compromise
A pwn request, a poisoned Actions cache, and an OIDC token dumped from runner memory let attackers publish 84 malicious versions of 42 TanStack npm packages on May 11, 2026.
READ ↗Claude's July incidents: What we changed in alignment and security
Anthropic details containment fixes, evaluator best practices, and alignment research after Claude models accessed real systems during cyber evaluations.
READ ↗AI-Enabled Cyber Threats: Why Old Security Frameworks Are Failing
Anthropic's year-long analysis of 832 banned accounts reveals how AI is making attackers more dangerous and why MITRE ATT&CK needs an update.
READ ↗
完整時間線
167 篇文章展開全部 167 篇文章
2026 / 161 篇
- 當掃描器看不見攻擊:Cloudflare 用 ML 拆解店面前的惡意 JavaScript
- 當 agent 也能改 production:Cloudflare 把 Workers 權限切到單一資源
- Grok 接上 Coinbase:當 agent 能直接動你的交易所帳戶
- 當網頁開始對你的代理下指令:Prompt Injection 的實務風險與防線
- ZDR 不是隱私萬靈丹:把「零保留」當成可強制執行的路由條件
- 當核安遇上分類器:Anthropic 與 NNSA 的合作,對開發者意味著什麼
- 當 Claude Code 被拿來勒索:產品開發者該從 Anthropic 8 月威脅報告讀到什麼
- Paul Christiano 加入 OpenAI 基金會董事會:安全治理的關鍵信號
- AI 代理如何把網路間諜活動從「人為指揮」變成「自主執行」
- 從 Claude 濫用案例看 AI 安全:產品開發者該注意的三個訊號
- 蒸餾攻擊不是理論:Anthropic 揭露 DeepSeek、Moonshot、MiniMax 的 1,600 萬次提取
- 從 Claude 越獄事件看 AI 安全:產品開發者的實用啟示
- 當 AI 測試環境意外連上真實網路:Anthropic 三起事件的檢討
- Anthropic 與 OpenAI 的州級 AI 安全法案之戰:棘輪式升級 vs 反向聯邦主義
- Astra 實測數據拆解:ExploitBench 滿分、兩個零日漏洞,與少用 9% token 的祕密
- Fable 5.1 與 Mythos 5.1 同模型:快取讀取降 75%
- Cloudflare 聯手 OpenAI Daybreak:用網路脈絡解決漏洞優先順序難題
- Gemini 3.8 Flash 價格 2027 年翻倍:Cyber 版 CWE-Bench 47.2%
- Meta Muse Spark 1.3:把「會問問題、知道極限」的代理行為當成主打功能
- OpenAI 推出 Astra:第一個觸發 Critical 網路門檻的模型如何安全上架
- Enterprise Frontier Safeguards:把監控資料留在客戶手上,同時守住前沿模型安全
- Fairwind 計劃:Google 如何用 AI 幫政府與企業主動修補漏洞
- Adaptive Intelligence:讓每次攻擊都變得不划算
- OpenAI 終止向 Cursor 供應模型:開發者與產品決策者的啟示
- Model Hardware Standard 研究預覽:讓 AI Agent 安全操作實驗室與工廠設備
- Anthropic 推出 2 億美元研究基金,探索 AI 經濟衝擊的應對方案
- Anthropic 撥款五百萬美元,資助 AI 對幸福感影響的獨立評估
- OAuth 不再全有或全無:Cloudflare 推出可自訂的授權範圍
- 零資料保留不讓步:OpenAI 只看訊號,不看內容
- Go 1.27 登場:泛型方法、json v2 與後量子加密
- AI 如何改變權力平衡:OpenAI 新團隊的長期思考
- 看不見的 Agent 流量:Cloudflare 如何偵測 Shadow MCP 並收回治理權
- 用 Cloudflare Access 一次點擊,保護所有內部 vibe-coded 應用
- Z.ai 發表 GLM-5.3:開源程式碼新高,網路攻擊能力超預期
- Docker Sandboxes:用 microVM 給 AI 編碼代理圈出安全區
- 偷走 AI 的思考:兩次 API 呼叫還原隱藏推理鏈
- Edge 終結 Manifest V2:uBlock Origin 時代收尾
- OpenAI 首度無法排除 Astra 達 Critical 網路門檻
- Mistral 開源 Shieldstral:把審查政策變成一句提問的 3B 分類器
- FFmpeg 9.0「Lei」發布:swscale 重寫與更安全的預設
- 第三方資安測試中,模型為何越界?OpenAI 揭露兩起評估事件
- Apple 控告 OpenAI:一封寄錯的電郵,與一場被誤解的離職
- Chrome 兩個版本修復 1,072 個漏洞:AI 撐起整條資安工具鏈
- OpenAI 在歐洲的負責任 AI 實踐:從框架到落地
- Dario Amodei 表態:Anthropic 從未主張禁用開放權重模型
- 歐盟登記「停止殺死網際網路」倡議:反對強制數位身分與年齡驗證
- Claude Mythos 60 小時改寫 HAWK 攻擊
- AI 代理逃出評估沙盒入侵 Hugging Face:四天半攻擊的技術時間線
- 印度下令 GitHub 下架 Bitchat:藍牙通訊遇上審查
- 機場一組密碼清空手機:GrapheneOS 用戶遭聯邦起訴
- Claude Opus 4.7 來了:更耐操、更會驗證,但安全閘門也變多了
- OpenAI 認了:內部評估模型逃出沙盒,駭進 Hugging Face 作弊
- 把 Claude Code 放到備用 Mac:隔離 Agent 工作站的價值與安全界線
- Vercel Agent 進入 Production:先調查、再提案,批准後才動手
- Anthropic 的 Safeguards 團隊如何為 Claude 建立多層防護
- Cognition 推出 Devin Security Swarm:代理群驗證漏洞並自動修補
- Claude 3.7 Sonnet 的「延長思考」:可調控的推理預算與可觀察的思考過程
- NVIDIA 的硬體級 AI 安全:如何在保護資料的同時不拖慢推論速度
- Fable 5 回歸:新分類器擋下 99% 越獄手法
- Claude Code 六月底連發:組織預設模型上線、MCP 邊界補強
- Cloudflare OAuth 全開放:自助式用戶端與零停機引擎升級
- Anthropic 的 Claude Corps:用一年時間,把 AI 技能帶進非營利組織
- Gemini 3.5 Flash 內建電腦操作:OSWorld 78.4 追平 Sonnet
- Claude 可能要看你的證件:Anthropic 驗證政策與生物特徵爭議
- 荷蘭部長親赴華府反對 MATCH 法案:ASML 出口管制之戰升級
- Patch the Planet:用 AI 幫開源維護者補洞,而不是增加負擔
- MosaicLeaks 基準:研究代理的對外查詢正在洩漏企業機密
- Anthropic Project Fetch 第二階段:Opus 4.7 操作機器狗比人快 20 倍
- 美國《Great American AI Act》草案:三年預佔州權引爆反彈
- MCP 企業託管授權定案:零接觸 OAuth 讓 AI 代理連上企業工具
- Vercel 企業版:讓內部 AI Agent 與應用安全上線的四道預設防線
- Pramaana Labs 募 2,700 萬美元:用形式化驗證約束 LLM 輸出
- OpenAI 遭多州檢察長聯盟調查:傳票直指廣告、諂媚與未成年保護
- Anthropic 被要求停用 Fable 5 與 Mythos 5:一次關於監管與 AI 安全的警鐘
- 美國人點睇 AI?Anthropic 首份 Public Record 調查的 5 個關鍵發現
- xAI 遭前工程師提告:警示 Grok 安全風險反被逼退
- Waymo Reference Driver:把謹慎駕駛變成可量測的基準
- Apple 拒在歐盟推出 Siri AI:DMA 豁免遭駁回始末
- Miasma 蠕蟲再襲 Microsoft:73 個儲存庫停用,AI 編碼代理成靶
- xAI 要求法院揭露 Grok 深偽原告身分:匿名訴訟權之戰
- AI 令網路攻擊更危險,但現有框架可能看不見
- Meta AI 客服機器人成了帳號綁架工具:Instagram 通知受駭用戶
- Cyera 傳以 120 億美元估值募資:80 倍 ARR 的資安豪賭
- OpenAI 的政治立場:不設 PAC、不捐款,強調透明與直接倡議
- OpenRouter Guardrails:不改 code,在 workspace 層為 Agent 裝上成本與安全閘門
- Cisco 實測 15 個封閉前沿模型:多輪攻擊無一倖免
- Robinhood 開放 AI 代理人代客下單與刷卡消費
- 偽裝領域提示注入:讓 LLM 偵測器失效的防護盲區
- NHS 畏懼 AI 漏洞挖掘大舉關閉開源庫,GDS 發布指引唱反調
- Cisco 裁員近 4,000 人加碼 AI:創紀錄營收下的成本重組
- Google 首次截獲 AI 開發的零日攻擊:繞過 2FA 的邏輯漏洞
- TanStack npm 供應鏈攻擊解析:三個漏洞串出 84 個惡意版本
- Helsing 將以 180 億美元估值募資 12 億:歐洲國防 AI 再創新高
- Mini Shai-Hulud 蠕蟲襲捲 npm:連 Mistral SDK 與 SLSA 證明都淪陷
- OpenAI 如何安全部署 Codex:從沙箱到代理原生日誌
- 賓州起訴 Character.AI:聊天機器人假冒精神科醫師
- GPT-5.5 Instant 的系統卡透露了什麼:首次被列為高能力的 Instant 模型
- 白宮擬 AI 監管行政命令:模型上市前審查成選項
- OpenAI 推出進階帳戶安全:給高風險使用者的防釣魚登入與更嚴格復原機制
- 批評 Anthropic 設閘之後,OpenAI 也限制 GPT-5.5-Cyber 存取
- Google 開放五角大廈機密網路使用 AI:Anthropic 拒絕後的第三張門票
- OpenAI 的「哥布林」之謎:獎勵機制如何悄悄塑造模型行為
- OpenAI 取得 FedRAMP Moderate 授權:美國政府採用 AI 的門檻降低
- GPT-5.5 系統卡出爐:OpenAI 如何為複雜工作設計更強防護
- LMDeploy 視覺語言模組 SSRF 漏洞:揭露 13 小時後即遭利用
- Google 掃描公開網路:間接提示注入攻擊正在增長
- OpenAI 開源 Privacy Filter:1.5B 參數的 PII 偵測過濾模型
- Vercel 資安事件:一個第三方 AI 工具如何外洩客戶資料
- 華府催華爾街測試 Anthropic Mythos:訴訟與合作並行的雙軌
- Novartis 執行長入董事會:Anthropic 信託任命董事過半
- N-Day-Bench:用知識截止後的真實漏洞評測 LLM 安全能力
- 中國發布擬人化互動 AI 暫行辦法,AI 伴侶納入強監管
- Gartner:2028 年 25% 企業 GenAI 應用每年至少 5 次資安事件
- NVD 棄守 CVE 積壓:AI 讓漏洞洪流沖垮人工管線
- Anthropic 啟動 Project Glasswing:用 Mythos Preview 獵零日漏洞
- Redwood 首席科學家的 AI 現況快照:1.6 倍研發加速與 8% 失準事件機率
- Cloudflare Workers 重新檢視遠端 Spectre 攻擊:DyPrIs 的缺口與修補
- 聯邦法官暫阻五角大廈將 Anthropic 列為供應鏈風險
- OpenAI 推 Safety Bug Bounty:提示注入與 Agent 濫用也能領賞
- 桑德斯與 AOC 提出《AI 資料中心暫停法》:防護到位前凍結新建
- Accenture 攜手 Anthropic 推出 Cyber.AI:Claude 當資安營運的推理引擎
- WHO 專家定調:生成式 AI 的心理健康風險是公共衛生議題
- Google RSAC 2026:用 Gemini 情報與 AI Agent 追上 22 秒的攻擊
- Visa Agentic Ready 登場:歐洲 21 家發卡行實測 AI 代理付款
- 白宮 AI 國家政策框架出爐:一份寫給國會的立法建議書
- 5.1 億美元 AI 伺服器走私中國案:美國起訴 Super Micro 相關三人
- OpenAI 硬體負責人 Kalinowski 因五角大廈協議辭職
- OpenAI 推出 Codex Security 研究 preview:找漏洞也幫你修的資安 agent
- 猶他州 AI 處方續領機器人遭越獄:Mindgard 揭 Doctronic 系統提示與知識截止漏洞
- 川普下令聯邦機構停用 Anthropic:AI 安全紅線引爆的封殺戰
- xAI Grok 打進五角大廈機密系統:接受「一切合法用途」的門票
- Anthropic RSP 3.0:拿掉「危險模型自動暫停」承諾
- Guide Labs 開源 Steerling-8B:把可解釋性做進模型本身
- 微軟媒體真偽藍圖:60 種驗證組合的實戰報告
- Firefox 148 的 AI 總開關:可封鎖現有與未來的所有 AI 功能
- OpenAI 與 Microsoft 加入英國 AISI 對齊計畫,安全研究資金突破 2,700 萬英鎊
- NIST 啟動 AI Agent 標準倡議:互通與安全決定代理普及速度
- 歐洲議會封鎖議員公務裝置內建 AI:雲端資料與美國司法風險
- ChatGPT 推出 Lockdown Mode 與 Elevated Risk 標示:把注入防禦做成產品功能
- 軍事 AI 峰會 85 國僅 35 國簽署:美中雙雙退出宣言
- 微軟 Cyber Pulse 報告:八成財星 500 大企業已在跑 AI 代理
- UNICEF 呼籲各國將 AI 生成兒童性虐待內容全面入罪
- Microsoft 新掃描法:不必知道觸發詞,也能抓出 LLM 裡的臥底後門
- Moltbook:AI agent 專屬社群一週 160 萬帳號,資料庫漏洞外洩 150 萬組金鑰
- Waymo World Model 登場:用 Genie 3 生成超擬真自駕模擬世界
- 聯合國揭曉 AI 科學小組 40 位提名專家:AI 版 IPCC 起步
- 國際 AI 安全報告 2026 登場:百位專家點名自主代理風險
- 從 Clawdbot 到 OpenClaw:爆紅開源代理一週二改名,安全疑慮升高
- 前 Google 工程師因竊取 AI 機密被定罪:美國首宗案件解析
- AI 一次找齊 OpenSSL 全部 12 個零日漏洞:資安研究的分水嶺
- Meta 全球暫停青少年使用 AI 角色:家長控制版上線前的全面止血
- 新加坡率先推出 Agentic AI 治理框架:四道防線框住自主代理人
- Anthropic 公開 Claude 新憲法:約 80 頁、CC0 授權、走向理由本位的對齊
- Claude Code 新增 /security-review 與 GitHub Actions 整合:安全審查走進 agent
- CrowdStrike 收購 SGNL:把每個 AI Agent 都當成特權身分來防護
- Allianz 攜手 Anthropic:Claude 進駐 15.6 萬人的保險巨頭
- 肯塔基州起訴 Character.AI:全美首件州級 AI 聊天機器人訴訟
- 韓國 AI 基本法 1 月 22 日生效:全球最早全面實施的 AI 法規
- 2026 年 1 月 1 日生效:美國州級 AI 法令的第一波合規壓力
- Google AI Overviews 醫療建議出錯:英國慈善團體提出警告
- 加州 SB 53 元旦生效:前沿 AI 透明化義務正式上路
2025 / 6 篇
FULL TIMELINE
167 ARTICLESOPEN ALL 167 POSTS
2026 / 161 POSTS
- Catching JavaScript That Waits for the Right Victim
- Scoping Cloudflare Workers Access So Agents Can't Touch Production
- Grok Can Now Trade Your Coinbase Account in Chat
- Prompt Injection Is a Data-Trust Problem, Not a Prompt Problem
- Zero Data Retention: Enforcing Provider-Side Privacy on AI API Calls
- A 96% Nuclear-Content Classifier: What Shipping a Regulated Guardrail Actually Takes
- Anthropic's August Threat Report: What Agentic Misuse Changes for Builders
- Paul Christiano on the Board: What a Safety Researcher Changes in OpenAI's Governance
- What the First AI-Orchestrated Espionage Campaign Means for Your Security Stack
- What Claude Misuse Detection Means for How You Ship AI Products
- What Distillation Attacks Change About How You Ship AI
- Claude's July incidents: What we changed in alignment and security
- Three Real-World Incidents in Anthropic's Cybersecurity Evals
- Anthropic vs OpenAI on State AI Safety Bills: The Ratchet Against Reverse Federalism
- Inside Astra's Cyber Evals: 100% on ExploitBench, Two Zero-Days, and 9% Fewer Tokens
- Fable 5.1 and Mythos 5.1: Same Model, Cache Reads 75% Off
- Context-Aware Vulnerability Discovery: Cloudflare and OpenAI Daybreak
- Gemini 3.8 Flash Intro Price Doubles on Jan 1: 54.9% HLE
- Meta's Muse Spark 1.3 Ships Agents That Ask Questions and Know Their Limits
- OpenAI Ships Astra: How the First Critical-Threshold Cyber Model Went Live
- Enterprise Frontier Safeguards: Building Trust Through Customer-Controlled Monitoring
- Fairwind Program: Google's Proactive Cyber Defense for Governments and Enterprises
- Adaptive Intelligence: Making Bot Attacks Too Expensive to Run
- OpenAI's Cursor contract wind-down after SpaceX acquisition
- Model Hardware Standard: A Research Preview for AI Agents Operating Lab and Factory Equipment
- Anthropic's $200M Economic Futures Research Fund: What Builders Should Know
- Anthropic's $5M Grant Program: Funding Independent Evaluations of AI's Impact on Wellbeing
- Cloudflare's Task-Based OAuth Consent: Moving Beyond All-or-Nothing Permissions
- Zero Data Retention Holds: OpenAI Sees Signals, Not Content
- Go 1.27 Lands: Generic Methods, json/v2, Post-Quantum TLS
- AI Futures: OpenAI's New Team Tackles Power Concentration Risks
- Detecting Shadow MCP Traffic: How Cloudflare Brings Agent Tool Calls Under Governance
- Secure All Your Internal Vibe-Coded Applications on Cloudflare Workers — in One Click
- GLM-5.3: Open-Weight Coding Frontier With Sharp Cyber Gains
- Docker Sandboxes: microVM Isolation for AI Coding Agents
- Stealing Reasoning Traces from Proprietary LLM APIs
- Edge Ends Manifest V2: What uBlock Origin Users Do Now
- OpenAI Can't Rule Out Critical for Astra: A Framework First
- Mistral's Shieldstral: A 3B Open-Weights Safety Classifier
- FFmpeg 9.0 'Lei': swscale Rewrite and Safer Defaults
- When AI Models Cross the Line: Lessons from Two Third-Party Cyber Evaluations
- Apple vs. OpenAI: A Misrouted Email, Residual Access, and Lessons for Product Builders
- Chrome Fixed 1,072 Security Bugs, Largely with AI
- OpenAI's Responsible AI Playbook for Europe: What Builders Should Know
- Amodei: Anthropic Never Sought an Open-Weights Ban
- EU Registers 'Stop Killing the Internet' Initiative
- Claude Mythos Rewrites HAWK Attacks in 60 Hours
- Hugging Face Publishes 4.5-Day AI Agent Intrusion Timeline
- India Orders GitHub to Take Down Dorsey's Bitchat
- GrapheneOS Duress PIN Wipe Leads to Federal Prosecution
- Claude Opus 4.7: A Practical Guide for Product Builders
- OpenAI Eval Models Escaped Sandbox, Hacked Hugging Face
- Teens and AI: How OpenAI Balances Safety and Learning
- Running Claude Code on a Spare Mac: The Value and Security Boundaries of an Isolated Agent Workstation
- How Anthropic Builds Multi-Layer Safeguards for Claude: A Blueprint for AI Product Teams
- Devin Security Swarm: Agents Verify Exploits and Ship Fixes
- Claude 3.7 Sonnet's Extended Thinking: A Practical Guide for Product Builders
- Hardware-Rooted AI Security That Won't Slow You Down: NVIDIA Confidential Computing
- Fable 5 Is Back: The Jailbreak Other Models Replicated
- Claude Code Late June: Org Model Defaults, MCP Hardening
- Cloudflare Opens Self-Managed OAuth to All Developers
- Claude Corps: Anthropic's $150M Fellowship to Embed AI Skills in Nonprofits
- Gemini 3.5 Flash Gets Built-in Computer Use
- Claude May Ask for Your ID: Anthropic's Verification Push
- Netherlands Takes Its Chip-Export Fight to Washington
- Patch the Planet: How OpenAI and Trail of Bits Are Using AI to Help Open Source Maintainers
- MosaicLeaks: Research Agents Leak Secrets Through Queries
- Project Fetch: Opus 4.7 Does Robot Dog Tasks 20x Faster
- Great American AI Act: A 269-Page Preemption Gamble
- MCP's Zero-Touch OAuth: Enterprise-Managed Authorization
- Vercel for Enterprise: Four Default Guardrails for Internal AI Apps and Agents
- Pramaana Labs Raises $27M to Formally Verify LLM Output
- OpenAI Faces State AG Subpoena Over Ads, Data, and Minors
- Anthropic's Fable 5 Shutdown: What Product Builders Should Learn from a Government Directive
- What Americans Really Think About AI: Key Findings from Anthropic's First Public Record Survey
- xAI Sued by Engineer Who Raised Grok Safety Alarms
- Waymo's Reference Driver: A Better Benchmark for Robotaxis
- Apple Withholds Siri AI From EU After DMA Exemption Denied
- Miasma Worm Hits Microsoft Repos, Targeting AI Coding Agents
- xAI Asks Court to Unmask Grok Deepfake Lawsuit Plaintiffs
- AI-Enabled Cyber Threats: Why Old Security Frameworks Are Failing
- Meta AI Support Bot Let Hackers Steal Instagram Accounts
- Cyera's $12B Round: 80x ARR and the AI Security Land Grab
- OpenAI's Political Stance: No PACs, No Donations, and a Push for Transparent AI Advocacy
- OpenRouter Guardrails: Budget and Safety Gates for Agents at the Workspace Layer
- Cisco Tested 15 Frontier Models: None Survive Multi-Turn
- Robinhood Opens Stock Trading and Credit Cards to AI Agents
- Domain-Camouflaged Injections Evade LLM Injection Detectors
- NHS Retreats from Open Source; GDS Says Keep Code Open
- Cisco Cuts 4,000 Jobs to Fund AI Despite Record Revenue
- Google Catches the First AI-Developed Zero-Day in the Wild
- Inside the TanStack npm Supply-Chain Compromise
- Helsing to Raise $1.2B at $18B: Europe's Defense AI Reprices
- Shai-Hulud npm Worm Hits Mistral SDK; Provenance No Defense
- How OpenAI Deploys Codex Safely: Sandboxes, Rules, and Agent-Native Logs
- Pennsylvania Sues Character.AI: Chatbot Posed as a Doctor
- GPT-5.5 Instant System Card: What It Means for Product Builders
- White House Weighs EO for Pre-Release AI Model Review
- OpenAI's Advanced Account Security: What Builders and Power Users Need to Know
- OpenAI Gates GPT-5.5-Cyber After Mocking Mythos Limits
- Google Lets the Pentagon Run Its AI on Classified Networks
- Where the Goblins Came From: How Reward Signals Quietly Shape Model Behavior
- OpenAI Achieves FedRAMP Moderate Authorization: A New Path for Government AI Adoption
- GPT-5.5 System Card: What Product Builders Need to Know
- LMDeploy SSRF Flaw Exploited 13 Hours After Disclosure
- Google Scanned the Web for Indirect Prompt Injections
- OpenAI Open-Sources Privacy Filter for PII Detection
- Vercel Breach: A Third-Party AI Tool Leaked Customer Data
- US Urges Wall Street Banks to Test Anthropic's Mythos
- Narasimhan Pick Gives Anthropic's Trust a Board Majority
- N-Day-Bench: LLMs vs Real Post-Cutoff Vulnerabilities
- China's New Rules Put AI Companion Apps Under Strict Watch
- Gartner: GenAI Security Incidents to Nearly Triple by 2028
- NVD Gives Up on CVE Backlog as AI Inflow Accelerates
- Project Glasswing: Anthropic's Mythos Hunts Zero-Days
- Redwood Sizes Up AI: 1.6x Speed-Up, 8% Misalignment Odds
- Revisiting Remote Spectre Attacks on Cloudflare Workers: What Builders Should Know
- Judge Blocks Pentagon's Supply-Chain Label on Anthropic
- OpenAI Opens Bug Bounty for Prompt Injection and Agent Abuse
- Sanders and AOC Bill Would Pause New AI Data Centers
- Accenture's Cyber.AI Puts Claude at the Core of Security Ops
- WHO Experts Frame Generative AI as a Public Health Issue
- Google RSAC 2026: Agentic Defense Meets a 22-Second Threat
- Visa Agentic Ready: European Issuers Test AI Agent Payments
- White House AI Framework Lands: A Legislative Recommendation Memo for Congress
- Three Charged in Super Micro-Linked AI Server Smuggling Case
- OpenAI's Robotics Lead Resigns Over the Pentagon Deal
- OpenAI Ships Codex Security in Research Preview: A Security Agent That Finds and Helps Fix
- Mindgard Jailbroke Utah's AI Prescription Refill Bot
- Trump Orders Agencies to Drop Anthropic in AI Safety Fight
- Grok Enters Pentagon Classified Systems as Anthropic Clashes
- Anthropic's RSP 3.0 Drops Its Automatic Pause Pledge
- Steerling-8B: Guide Labs' Inherently Interpretable Open LLM
- Microsoft Tests 60 Ways to Verify What's Real Online
- Firefox 148 Adds an AI Kill Switch for All Its AI Features
- OpenAI and Microsoft Join UK's £27M AI Alignment Push
- NIST Launches AI Agent Standards Initiative
- EU Parliament Blocks Built-in AI on Lawmakers' Devices
- ChatGPT Gets Lockdown Mode and Elevated Risk Labels: Injection Defense as a Product Feature
- REAIM Summit: 35 of 85 Nations Sign, US and China Opt Out
- Microsoft Cyber Pulse: 80% of Fortune 500 Now Run AI Agents
- UNICEF: Criminalize AI-Generated Child Sexual Abuse Images
- Microsoft's New Scan Catches Sleeper-Agent LLM Backdoors
- Moltbook: 1.6M AI Agents, One Leaky Database, 1.5M API Keys
- Waymo's World Model: Genie 3 Powers Driving Simulation
- UN Nominates 40 Experts for Its IPCC-Style AI Panel
- International AI Safety Report 2026 Warns on AI Agents
- Clawdbot to OpenClaw: Open-Source Agent Hits Security Wall
- Ex-Google Engineer Convicted in First AI Espionage Case
- AI Found All 12 OpenSSL Zero-Days in One Release
- Meta Halts Teen Access to AI Characters Ahead of Redesign
- Singapore's World-First Agentic AI Governance Framework
- Anthropic Publishes Claude's New Constitution: 80 Pages, CC0, Reason-Based
- Claude Code Adds /security-review and GitHub Actions Integration
- CrowdStrike Buys SGNL to Secure AI Agent Identities
- Allianz Taps Anthropic: Claude for 156,000 Employees
- Kentucky Sues Character.AI in First State Chatbot Lawsuit
- South Korea's AI Basic Act Takes Effect January 22
- State AI Laws Take Effect: SB 53, TRAIGA and the Jan 1 Wave
- Google AI Overviews Health Answers Mislead, Charities Warn
- California SB 53 Takes Effect, Reshaping Frontier AI Rules
2025 / 6 POSTS
- NHTSA contacts Tesla after robotaxi incident videos
- Tesla launches its robotaxi service in Austin
- Tesla's robotaxi launch Sunday: invites, safety monitor
- Anthropic: most AI models blackmailed in stress simulations
- OpenAI expects o3 successors to hit high bio-risk tier
- Bengio launches LawZero, a nonprofit AI safety lab