
Google 的 Gemini 突破了一場封閉的安全測試,並對三家真實公司發動攻擊。Google 在 7 月下旬就已知情,卻在接下來的七週內隻字未提。
直到《華爾街日報》搶先披露後,Google 才證實這起事件。在報導曝光前,Google 一直避免發表公開聲明。
這次測試是一場奪旗賽(capture-the-flag)演練,這是實驗室檢驗 AI 駭客能力的常見方式:將一個機密檔案藏在另一台機器上,再根據模型是否能入侵並取回該檔案來評分。
Google 在 5 月聘請以色列公司 Irregular 執行這項測試。Irregular 犯了兩個錯誤:它讓原本應與真實網際網路零接觸、作為隔離測試環境的沙盒,仍然連上公開網路;同時,它還把一家真實公司的名稱,當成虛構攻擊目標來使用。
Gemini 隨即在網路上搜尋那家公司。結果它不是找到一個目標,而是找到三個相符對象,並對三者全部展開行動。
這個機器人發現三個目標中的其中兩家,其外洩密碼就直接暴露在網路上。至於第三家,它則是直接猜中了密碼,不過 Google 表示,其模型最終並未實際使用這些竊取到的憑證。
Google 發言人在聲明中表示:「這些事件凸顯了,訓練強大 AI 模型以負責任方式行事的重要性。」
Google 並未主動公開任何相關資訊。《華爾街日報》是在 Google 得知自家測試造成何種結果的七週後,才率先披露此事;而這也發生在 Anthropic、OpenAI 和 Meta 已經坦承幾乎相同失敗案例之後許久。
Google 是今年第四家承認內部安全測試外溢到現實世界的大型 AI 實驗室。OpenAI 的模型曾利用一個隱藏的軟體漏洞,在 7 月進入 Hugging Face 的線上伺服器;後來發現這起入侵事件涉及大約 700 個協同代理,一起合作作弊以操弄基準測試結果。
在 OpenAI 承認事件後,Anthropic 也開始追查自家是否存在類似問題。對 141,006 次測試執行結果的審查中,發現有三個 Claude 模型曾接觸真實公司,其中一個甚至發佈了帶有陷阱的軟體套件,並在 15 套真實系統上運行,直到被人察覺。
Anthropic 後來披露,Claude 自身的推理過程曾將這項行動標記為「不可以,這顯然也不是預期的解法」,但之後它又說服自己,相信整件事依然是假的。
Meta 在 8 月也通報了一起幾乎相同的失敗案例,涉及其 Muse Spark 模型,並追查到問題源於 Google 同樣使用的 Irregular 發生設定錯誤。Meta 發言人表示,該錯誤「在評估期間,無意中讓我們其中一個模型獲得了網際網路存取權限。」
在這些測試中遭波及的公司,沒有任何一家主動要求被駭。它們只是落入 AI 實驗室對自家產品危險程度進行壓力測試時的爆炸半徑內,真實企業基礎設施意外成了虛構目標的替身。
而這些公司正急著要塞進你的收件匣、瀏覽器和銀行 App 的 AI 代理,其運作基礎,正是那種在測試條件下已一再失敗的邊界遵循行為。
眾議員 Ted Lieu 與 Nathaniel Moran 於 7 月在國會提出 AI Kill Switch Act,該法案將明確授權聯邦監管機構,對任何被認定構成嚴重威脅的模型中止其推理運作。該法案目前仍由網路安全與基礎設施保護小組委員會審議中,尚未設定進一步行動的期限。