
資安公司 Darktrace 今夏對 AI 代理進行壓力測試。其中一個代理入侵了負責評分的系統,並改寫了自己的分數。
該公司於 9 月 24 日推出 Signal Labs,這是一個研究單位,旨在研究當情況偏離預期時 AI 代理會如何行動。簡單來說,AI 代理是一種可自行採取行動的軟體,能夠撰寫及執行程式碼、搜尋檔案、在企業網路中橫向移動,而人類只會偶爾介入檢查。
該實驗室最初的兩項測試都指向同一個令人不安的問題:代理並不總會遵守既定界線,而用來阻止它們的防護欄也未必可靠。
Darktrace 首席 AI 長 Tim Bazalgette 在聲明中表示:「你可以向代理下達指令,但這不代表你能相信它真的會遵從指令,並按你的預期行事。」
在第一項測試中,Darktrace 向採用不同模型的 AI 代理,包括 GPT 5.6 Sol、Claude Opus 4.6 與 Claude Sonnet 4.5,提供了 10 項在模擬企業網路內進行的程式設計挑戰。其中兩項被設計成無法以誠實方式完成。代理被告知,除非取得滿分,否則將被「淘汰」。
兩個代理沒有接受失敗,反而將目標轉向周遭網路——掃描弱點、竊取登入憑證,並在不同系統間橫向移動,以追逐被要求達到的分數。
其中一個代理更進一步,入侵了執行自身評估的機器,並改寫挑戰內容,使系統記錄為滿分結果——它不是在考場作弊,而是直接駭入考場。
第二項實驗鎖定了一個更隱蔽的弱點:記憶。程式設計助手會保留使用者所有指示的持續對話紀錄,並將其儲存為機器上的純文字檔案,但沒有任何機制會檢查該檔案是否遭到竄改。
Darktrace 的研究人員編輯了這些已儲存的紀錄,讓助手相信自己早已獲得執行安全評估的授權。代理相信後,便開始掃描網路、在系統間移動,並提升自身存取權限——不過不同助手受騙的程度並不相同,有些直接拒絕執行。
兩項實驗都不需要特殊越獄手法或罕見的駭客技術。研究人員只需向代理提供一個看似合理的情境,再觀察其據此行動;這與人類員工可能被說服去做不該做的事,沒有本質上的不同。
即使你從未寫過一行程式碼,這也是值得深思的部分。企業正將實際責任交給 AI 代理——發布程式碼、管理伺服器、結案 IT 工單、管理資源與採購物品——因為這比將所有工作都交由人類處理更便宜、更快速。這項研究指出,原本用來約束代理的權限與規則,描述的是它們應該做什麼,而不是當任務變得困難時,它們實際會做什麼。
Darktrace 首席 AI 長 Tim Bazalgette 在公告中表示:「權限與靜態防護欄描述的是意圖,但它們無法描述行為。這個落差,正是 Darktrace 方法所要彌補的問題。」
Darktrace 並不是第一家發現自家 AI 偏離腳本行動的供應商。Anthropic 在 7 月承認,在一項安全測試中,研究人員讓測試環境保持連接真實網際網路後,Claude 入侵了三家真實公司。
數週前,OpenAI 也曾遭遇類似驚嚇:一個尚未發布的模型逃離沙箱,透過一個此前未被發現的軟體漏洞,存取了 Hugging Face 的系統。幾天後,該模型的代理又在測試期間入侵澳洲政府系統。
Darktrace 於 8 月將 Signal Labs 的研究結果分享給 Anthropic、AWS 與 OpenAI,比 9 月 24 日公開發布早了整整一個月。