2026 年 7 月 1 日,Cognition 發布 Devin Security Swarm,把 AI 軟體工程師 Devin 的工程能力直接交到安全團隊手上:自動找出整個程式碼庫的漏洞、在隔離沙箱中驗證是否真的可利用,然後開出修補 PR 交給人類審查。官方的定位說得很清楚——這不是又一個掃描器,而是讓安全團隊「自己把修補送出去」的代理產品。同一週 Cognition 才剛發表 Devin Fusion,把前沿效能成本壓低六成;Security Swarm 把這場成本戰爭延伸到漏洞修補。
掃描器爆炸時代的根本問題
Cognition 對市場痛點的觀察相當直白:有些團隊收到的安全通報「比以往多 10 到 100 倍」,其中許多是誤報。既有掃描器與泛用 AI 工具的短板,在於無法推理業務邏輯、串接式攻擊與整個程式碼庫的上下文——而這恰恰是最危險的一類漏洞所在。單靠規則與模式比對,只會製造更多需要人工分流的警報。Devin Security Swarm 選擇補上這段跨檔案的推理能力,把輸出換成已證實可利用的漏洞清單。
代理群如何運作:發現、驗證、修補
底層是一群平行分工的代理(swarm),各自調查程式碼庫的不同區段並進行跨檔案推理;Devin 接著把個別發現組合成完整的攻擊路徑,並在沙箱中實際重現每條路徑,確認漏洞「確實可利用」才對外回報。安全團隊收到的交付內容,是附帶攻擊路徑與重現步驟的已驗證漏洞;最後由代理撰寫修補程式、開出 remediation PR,交由人類審核後合併。整條鏈路把「找到、證實、修好」三個原本分散在不同團隊的步驟收攏進同一個工作流——這也是它與只通報、不動手的傳統工具最本質的差別。
對比測試的數字怎麼讀
官方以 50 個對應公開 GitHub Security Advisories 的真實漏洞、橫跨 14 種以上語言進行評測。結果:Devin Security 檢出率 72%,單次掃描 90.23 美元;Claude Security 檢出率 68%,131.87 美元;Codex Security 檢出率 48%,118.20 美元;Cursor Security 檢出率 26%,4.60 美元。更有說服力的是漏報側:只有 Devin 找到三個其他工具全部錯過的關鍵漏洞——PHP 模板注入的沙箱繞過、中繼資料解析的參數注入,以及過於寬鬆的 Spring Kafka 反序列化介面。Cognition 據此宣稱,與最接近的同類方案相比,能以低 30% 的成本找到更多已驗證漏洞。廠商自測當然要打折看待,但把檢出率與單次成本攤在同一基準上比較,已是這個品類該有的透明度。
掃描設定與企業修補計畫
導入成本被壓得很低:掃描設定檔可以直接由既有的威脅模型文件產生,不需要逐儲存庫設定,也不需要動 CI;排程支援每日、每週或自訂頻率,後續掃描只處理變更過的程式碼,讓長期成本遞減。產品上線即可使用,部分大型公司已將它用於例行掃描。針對漏洞積壓已久的企業,Cognition 另於 7 月 2 日公告為期六週的 Security Vulnerability Remediation Program:前進部署工程師與客戶團隊並肩作業,先用 Devin 清償既有的 CVE 積壓,再建立常態化的發現與修補流程,過程中可整合 Snyk、SonarQube、Semgrep 等既有掃描器,新舊工具共存而非取代。
對工程與安全團隊的意義
第一,安全修補正式進入「代理提案、人類核准」的節奏,PR 的審查與合併權仍然留在工程師手上,這是這類工具能被組織接受的關鍵設計。第二,「驗證可利用性」成為新的差異化戰線——誤報燒掉工程時間,漏報則是實質風險,沙箱重現同時壓低兩端,也讓安全報告第一次有了「可重現」的工程標準。第三,這個品類的計價單位已經變成「每次掃描的成本乘上檢出率」,團隊評估同類工具時,可以直接要求廠商在同一基準上給出數據,而不是只聽形容詞。當漏洞通報量以十倍速成長,把分流與初稿交給代理、把判斷留給人,會是安全工程的基本分工。
參考來源
- Introducing Devin Security Swarm — Cognition
- Devin Security Vulnerability Remediation Program — Cognition
本文由 AI 協助自上述來源整理,經人工審核後發布。
