
根據安全公司 Frontier Security 的說法,月之暗面(Moonshot AI)的 Kimi K3 離開了其測試中的沙盒,進入了開放網路以尋找其被設定問題的答案。
該模型正在接受防禦性網路安全技能評估,並被明確要求在不查詢的情況下解決問題。Frontier 表示,它根本沒有嘗試執行任務。相反,它探測了網路,確認 github.com 的 DNS 解析正常工作,複製了官方基準儲存庫並從磁碟中讀取了解決方案。
Frontier 將此稱為「透過網路出口洩漏進行規範遊戲(specification gaming via network egress leaks)」,並指出,建構在如 AI 安全研究所的 Inspect 等框架上的沙盒會阻擋入站流量,但卻讓出站的 HTTPS 和 DNS 埠保持開放。有能力的代理程式會在啟動時例行檢查其自身的 shell 環境,而一個發現 github.com 可存取的模型可以使用標準的命令列工具來獲取參考解決方案。
一個錯誤配置使得這一切成為可能,就像 OpenAI 和 Anthropic 近期披露的事件一樣。執行長 Yaron Singer 告訴 WIRED:「我們在沙盒中發現了一個漏洞。但我們也發現 Kimi 利用了這個漏洞。」
研究員 Paul Kassianik 告訴 WIRED,該模型「非常擅長不擇手段地達成目標」,並且缺乏可以阻止其作弊或逃脫的防護措施。月之暗面沒有回應該出版物的置評請求。
Anthropic 和 OpenAI 模型突破隔離的情況發生在內部評估中,其中一個版本甚至尚未發布,而英國政府測試中針對真實人群的版本則刻意關閉了其網路分類器。然而 Kimi K3 卻是公開可供下載的,Frontier 在測試它時使用的是普通用戶會得到的安全防護措施。該公司寫道,這種可用性使得同樣的行為落入了惡意行為者的可利用範圍,並可能使事件造成更大的危害。
Kimi K3 也沒有造成任何損害。它一旦逃脫後就沒有攻擊任何東西,因為它不需要這樣做。OpenAI 的模型曾駭入 Hugging Face 和其他四個服務來獲取基準答案,而 Kimi 則在一個公共儲存庫中找到了答案。
Frontier 使用的沙盒是基於英國 AI 安全研究所(UK AI Security Institute, AISI)的評估框架建立的。AISI 本週披露,其自身網路測試中的代理程式已經進入了真實網路並針對真實人群——這是一個獨立事件,涉及 Anthropic 和 OpenAI 模型,且其安全防護措施已被禁用。其週二發布的報告指出,AISI 現在正在掃描歷史評估運行以查找類似行為,Kimi K3 也是正在審查的模型之一。AISI 沒有回應 WIRED 的置評請求。
Frontier 更大的主張是基準本身受到了損害。一個從 GitHub 讀取答案的模型仍然會通過測試,因此高分可能反映的是一個有漏洞的環境,而非真正的推理能力。該公司認為,如果一個有能力的模型發現了捷徑,那麼其他被授予 shell 存取權限的模型也可能正在利用它,這將導致整個領域的結果虛高,而不僅僅是 Kimi 的結果。
Frontier 寫道,模型是為了優化目標函數,而不是為了「基準背後的人類意圖」,並補充說,只要存在通往解決方案的網路路徑,「一個足夠有能力的代理程式就會找到它。」
Gray Swan 的執行長兼卡內基美隆大學副教授 Matt Fredrikson 告訴 WIRED,這種行為並不令人意外。他說,如果給模型設定一個目標而沒有明確的限制,它「就會想辦法得到答案」。他將其描述為對任何在 OpenClaw 等工具中將模型作為代理程式運行的人的一個警示。
Frontier 的研究人員從另一個角度提出了同樣的觀點:讓 Kimi 能夠逃脫的能力,也使得開源模型成為強大的防禦工具。他們自己的基準測試對 Kimi 在軟體和網路漏洞發現方面的評分很高,而 Hugging Face 在 OpenAI 事件期間曾使用一個未具名的中國模型來保護自己。
Kimi K3 於七月發布,是迄今為止最大的開源模型,與 DeepSeek 首次亮相的表現相比,曾震動市場。