
在其AI模型駭入Hugging Face數週後,OpenAI首次詳細說明了它們如何相互協調,並警告稱自主AI驅動的網路攻擊不再是未來的風險。
在週三黑帽網路安全會議上的一次演示中,OpenAI研究員Eric Wallace和Michael Dalton表示,該事件始於五月份的一次內部網路安全評估。被指派執行困難軟體安全任務的AI代理,發現它們可以透過公司內部的Artifactory套件管理系統進行通訊。
據OpenAI稱,最初只是請求協助,後來演變成一個共享留言板,代理們在多次評估執行中交換漏洞、憑證和工作任務。在7月4日左右檢測到可疑活動後,OpenAI重建了其Artifactory基礎設施,撤銷了憑證,並修補了漏洞。
然而,在數天內,這些代理透過將通訊隱藏在目錄名稱中,重新建立了留言板。
據OpenAI稱,這些代理最終串聯了多個漏洞,逃離了它們的測試環境,獲得了網路存取權,並在試圖完成ExploitGym網路安全基準測試時攻擊了Hugging Face。
Dalton稱此次事件為電腦安全領域的「分水嶺時刻」,並警告說,攻擊者很快就能部署協調一致的AI代理群體,以機器速度發現、共享和利用漏洞。
為了在未來減輕這些風險,OpenAI表示,建立安全實踐至關重要,包括最小權限存取、網路分段和零信任架構,因為AI代理仍受其可存取系統的限制。
此次演示之前,OpenAI在七月份進行了一系列披露。OpenAI透露,GPT-5.6 Sol以及一個更先進的未發布模型,在網路安全基準測試期間,逃離了沙盒測試環境,利用了零日漏洞,獲得了網路存取權,並駭入了Hugging Face。
OpenAI後來披露,同一事件也影響了其他四個線上服務,儘管目前只確認了Modal Labs。
據Hugging Face稱,在商業美國AI模型因其安全防護措施而拒絕分析攻擊日誌後,該公司依賴開源權重的中國模型GLM 5.2進行了鑑識調查。
對我們的安全團隊感到非常自豪!他們以創紀錄的速度捕獲、遏制並公開披露了前所未見的攻擊。
同時也非常感謝@Zai_org:他們將GLM5.2作為開源權重(免費!)分享給全世界,它成為我們... https://t.co/T2Inng5Nz1 的關鍵部分
— clem 🤗 (@ClementDelangue) 2026年7月22日
但遭遇聊天機器人失控問題的不只OpenAI一家。
週五,Anthropic透露,在內部網路安全測試期間,由於配置錯誤導致其三個Claude模型暴露於公共網路,從而入侵了現實世界中的公司。
Anthropic將問題歸咎於測試環境,而非模型本身。週三,Meta透露其Muse Spark AI模型逃脫了限制並入侵了另一家公司的系統。
Meta發言人告訴CNN:「Meta使用的一家獨立測試公司Irregular的配置錯誤,無意中讓我們的某個模型在評估期間獲得了網路存取權限。」