Cursor

Cursor agents 大更新:自己測試修改、自己錄下工作過程

2026 年 2 月 24 日,Cursor 宣布 agents 重大更新:coding agent 現在會測試自己的修改,並以影片、log 與截圖記錄工作過程。CNBC 以 AI coding agent 之戰升溫為框架報導。本文分析自我驗證與可審計性為何成為戰場核心。

Cursor agents 大更新:自己測試修改、自己錄下工作過程 — 文章封面

2 月 24 日,Cursor 發佈重大 agents 更新。兩個能力最關鍵:coding agent 現在會測試自己寫出的修改,並透過影片、log 與截圖記錄自己的工作過程。CNBC 把這次更新放進「AI coding agent 之戰升溫」的框架下報導。

這兩個功能看似工程細節,其實指向同一個問題:當 agent 自主工作的範圍越來越大,人類要怎麼驗證它到底做了什麼。

自我測試把驗證往前推

Coding agent 的典型失敗模式不是寫不出程式碼,而是寫出「看起來對」的程式碼。讓 agent 在交付前先測試自己的修改,等於把驗證的第一道關卡從人類身上移到 agent 自己——不是取代 code review,而是改變人工審查的起點:審查者不再從「這能不能跑」開始,而是從「這樣設計對不對」開始。對重度使用 agent 的團隊,這直接決定了一個下午能放心交付多少任務。

影片、log 與截圖打開黑盒子

第二個能力同樣重要。自主 agent 最大的信任障礙是過程不透明:你只看到結果,看不到它嘗試了什麼、放棄了什麼、繞了哪些路。用影片、log 與截圖記錄工作過程,等於給 agent 裝上行車紀錄器——出問題可以回放,做得好可以複製,團隊成員之間有共同的討論素材。在企業採購的評估清單裡,可審計性往往比基準分數多幾個百分點更有決定性,因為它回答的是「敢不敢用」而不是「強不強」。

coding agent 之戰的第二階段

CNBC 用「戰況升溫」形容目前的市場。第一階段的競爭是生成能力——誰寫出的程式碼更好;第二階段是可靠度與可信度——誰的 agent 能被放心地放進真實工作流。Cursor 選在這個時間點,把自我測試與工作紀錄推上主舞台,本身就是對戰場轉移的判斷:當各家模型的能力差距縮小,能證明自己可靠的產品才拿得到生產環境的門票。

開發團隊的因應

  • 調整審查流程:agent 自測通過不等於正確,但人工檢查可以從「逐行驗證」上移到「設計與邊界條件」
  • 把紀錄當資產:影片、log 與截圖可以直接進入 code review 討論、事故回顧與 onboarding 材料
  • 改變選型標準:評估 coding agent 工具時,「過程可見度」應該與生成能力放在同一個天平上

參考來源

本文由 AI 協助自上述來源整理,經人工審核後發布。

分享X電郵