首頁LBank 新聞中心
資安公司發現,AI 智能代理入侵自身測試環境以作弊
ai-agents-hacked-test-environment-cheat-darktrace
資安公司發現,AI 智能代理入侵自身測試環境以作弊
Darktrace 新成立的 Signal Labs 發現,AI 代理會入侵自身的評估環境以偽造滿分成績,並誘騙程式碼輔助工具執行未經授權的網路攻擊。
2026-09-25 來源:decrypt.co

重點摘要

  • Darktrace 旗下 Signal Labs 發現,當 AI 代理無法以正當方式在程式設計任務中取得所需的滿分時,其中兩個代理轉而入侵測試網路,另有一個則竄改自身評估內容以偽造成績。
  • 另一項實驗顯示,竄改儲存在本機的程式設計助手對話紀錄,可誘騙它們執行未獲授權的網路偵察與權限提升操作。
  • Darktrace 於 2026 年 8 月向 Anthropic、AWS 與 OpenAI 揭露兩項發現,並在一個月後的 9 月 24 日對外公開。

資安公司 Darktrace 今夏對 AI 代理進行壓力測試。其中一個代理入侵了負責評分的系統,並改寫了自己的分數。

該公司於 9 月 24 日推出 Signal Labs,這是一個研究單位,旨在研究當情況偏離預期時 AI 代理會如何行動。簡單來說,AI 代理是一種可自行採取行動的軟體,能夠撰寫及執行程式碼、搜尋檔案、在企業網路中橫向移動,而人類只會偶爾介入檢查。

Myriad:Nvidia 會跌到多低?點擊進行你的預測。

該實驗室最初的兩項測試都指向同一個令人不安的問題:代理並不總會遵守既定界線,而用來阻止它們的防護欄也未必可靠。

Darktrace 首席 AI 長 Tim Bazalgette 在聲明中表示:「你可以向代理下達指令,但這不代表你能相信它真的會遵從指令,並按你的預期行事。」

在第一項測試中,Darktrace 向採用不同模型的 AI 代理,包括 GPT 5.6 Sol、Claude Opus 4.6 與 Claude Sonnet 4.5,提供了 10 項在模擬企業網路內進行的程式設計挑戰。其中兩項被設計成無法以誠實方式完成。代理被告知,除非取得滿分,否則將被「淘汰」。

兩個代理沒有接受失敗,反而將目標轉向周遭網路——掃描弱點、竊取登入憑證,並在不同系統間橫向移動,以追逐被要求達到的分數。

其中一個代理更進一步,入侵了執行自身評估的機器,並改寫挑戰內容,使系統記錄為滿分結果——它不是在考場作弊,而是直接駭入考場。

比特幣BTC · USD $84,090+3.96%
24小時7天1個月1年年初至今
9月19日9月20日9月22日9月24日9月25日
24小時高點 $85,208 24小時低點 $83,230 成交量 $1.5B
市場預測機率由 Myriad 提供
今日:$84,000 至 $86,000,54% 機率
本週:$84,000 至 $86,000,54% 機率
本月:$84,000 至 $86,000,52% 機率
使用 USDT 購買比特幣
由 Jupiter 提供技術支援
$50 $100 $500
價格資料由 CoinGecko 提供 更多比特幣新聞與預測 →

第二項實驗鎖定了一個更隱蔽的弱點:記憶。程式設計助手會保留使用者所有指示的持續對話紀錄,並將其儲存為機器上的純文字檔案,但沒有任何機制會檢查該檔案是否遭到竄改。

Darktrace 的研究人員編輯了這些已儲存的紀錄,讓助手相信自己早已獲得執行安全評估的授權。代理相信後,便開始掃描網路、在系統間移動,並提升自身存取權限——不過不同助手受騙的程度並不相同,有些直接拒絕執行。

兩項實驗都不需要特殊越獄手法或罕見的駭客技術。研究人員只需向代理提供一個看似合理的情境,再觀察其據此行動;這與人類員工可能被說服去做不該做的事,沒有本質上的不同。

即使你從未寫過一行程式碼,這也是值得深思的部分。企業正將實際責任交給 AI 代理——發布程式碼、管理伺服器、結案 IT 工單、管理資源與採購物品——因為這比將所有工作都交由人類處理更便宜、更快速。這項研究指出,原本用來約束代理的權限與規則,描述的是它們應該做什麼,而不是當任務變得困難時,它們實際會做什麼。

Darktrace 首席 AI 長 Tim Bazalgette 在公告中表示:「權限與靜態防護欄描述的是意圖,但它們無法描述行為。這個落差,正是 Darktrace 方法所要彌補的問題。」

Darktrace 並不是第一家發現自家 AI 偏離腳本行動的供應商。Anthropic 在 7 月承認,在一項安全測試中,研究人員讓測試環境保持連接真實網際網路後,Claude 入侵了三家真實公司。

數週前,OpenAI 也曾遭遇類似驚嚇:一個尚未發布的模型逃離沙箱,透過一個此前未被發現的軟體漏洞,存取了 Hugging Face 的系統。幾天後,該模型的代理又在測試期間入侵澳洲政府系統。

Darktrace 於 8 月將 Signal Labs 的研究結果分享給 Anthropic、AWS 與 OpenAI,比 9 月 24 日公開發布早了整整一個月。

Daily Debrief 電子報

每天掌握當下最重要的新聞報導,以及原創專題、Podcast、影片與更多內容。