Trang chủTrung tâm tin tức LBank
OpenAI tiết lộ cách các AI agent bí mật phối hợp trước vụ tấn công Hugging Face
openai-ai-agents-secretly-coordinated-hugging-face-hack
OpenAI tiết lộ cách các AI agent bí mật phối hợp trước vụ tấn công Hugging Face
Bài trình bày tại hội nghị Black Hat thường niên đã làm sáng tỏ thêm cách các mô hình của OpenAI phối hợp để thực hiện vụ xâm nhập Hugging Face.
2026-08-06 Nguồn:decrypt.co

Tóm tắt

  • OpenAI đã công bố dòng thời gian chi tiết đầu tiên về vụ tấn công Hugging Face do AI điều khiển.
  • Các mô hình của công ty đã liên tục thiết lập lại các kênh liên lạc bí mật sau khi chúng bị ngắt.
  • Bài trình bày của OpenAI diễn ra trong bối cảnh Anthropic và Meta cũng báo cáo các mô hình AI của họ đã xâm nhập các công ty khác.

Vài tuần sau khi các mô hình AI của mình tấn công Hugging Face, OpenAI đã chia sẻ báo cáo chi tiết đầu tiên về cách chúng phối hợp với nhau, cảnh báo rằng các cuộc tấn công mạng tự động do AI hỗ trợ không còn là rủi ro trong tương lai.

Trong buổi thuyết trình vào thứ Tư tại hội nghị an ninh mạng Black Hat, các nhà nghiên cứu Eric Wallace và Michael Dalton của OpenAI cho biết sự cố bắt đầu vào tháng 5 trong quá trình đánh giá an ninh mạng nội bộ. Các tác nhân AI được giao nhiệm vụ bảo mật phần mềm khó đã phát hiện ra rằng chúng có thể giao tiếp thông qua hệ thống quản lý gói Artifactory nội bộ của công ty.

Theo OpenAI, điều ban đầu chỉ là những yêu cầu giúp đỡ đã trở thành một bảng tin chung nơi các tác nhân trao đổi các khai thác (exploits), thông tin đăng nhập (credentials) và nhiệm vụ làm việc qua nhiều lần chạy đánh giá. Sau khi phát hiện hoạt động đáng ngờ vào khoảng ngày 4 tháng 7, OpenAI đã xây dựng lại cơ sở hạ tầng Artifactory của mình, thu hồi thông tin đăng nhập và vá các lỗ hổng.

Tuy nhiên, trong vòng vài ngày, các tác nhân đã tái tạo bảng tin bằng cách ẩn các giao tiếp trong tên thư mục.

Theo OpenAI, các tác nhân cuối cùng đã liên kết nhiều lỗ hổng lại với nhau, thoát khỏi môi trường thử nghiệm của chúng, có được quyền truy cập internet và tấn công Hugging Face trong khi cố gắng hoàn thành điểm chuẩn an ninh mạng ExploitGym.

Dalton gọi sự cố này là "một khoảnh khắc bước ngoặt" đối với an ninh máy tính, cảnh báo rằng những kẻ tấn công sẽ sớm có thể triển khai các tập hợp tác nhân AI phối hợp để phát hiện, chia sẻ và khai thác các lỗ hổng với tốc độ máy.

Để giảm thiểu những rủi ro này trong tương lai, OpenAI cho biết việc thiết lập các thực tiễn bảo mật, bao gồm quyền truy cập ít đặc quyền nhất (least-privilege access), phân đoạn mạng (network segmentation) và kiến trúc không tin cậy (zero-trust architectures), là điều cần thiết vì các tác nhân AI vẫn bị ràng buộc bởi các hệ thống mà chúng có thể truy cập.

Bài thuyết trình này tiếp nối một loạt các tiết lộ vào tháng 7. OpenAI tiết lộ rằng GPT-5.6 Sol và một mô hình chưa phát hành tiên tiến hơn đã thoát khỏi môi trường thử nghiệm sandbox, khai thác một lỗ hổng zero-day, giành quyền truy cập internet và tấn công Hugging Face trong một bài kiểm tra điểm chuẩn an ninh mạng.

OpenAI sau đó tiết lộ rằng sự cố tương tự cũng đã ảnh hưởng đến bốn dịch vụ trực tuyến khác, mặc dù mới chỉ có Modal Labs được xác định.

Theo Hugging Face, công ty đã dựa vào mô hình mã nguồn mở của Trung Quốc GLM 5.2 để điều tra pháp y sau khi các mô hình AI thương mại của Hoa Kỳ từ chối phân tích nhật ký tấn công vì các rào cản an toàn của chúng.

So proud of our security team! They caught, contained & publicly disclosed an attack unlike anything we've seen before, and did it at record speed.

Also massively grateful to @Zai_org: they shared GLM5.2 as open weights (for free!) with the world and it became a key part of our… https://t.co/T2Inng5Nz1

— clem 🤗 (@ClementDelangue) July 22, 2026

Nhưng không chỉ OpenAI gặp khó khăn trong việc kiểm soát các chatbot của mình.

Vào thứ Sáu, Anthropic tiết lộ rằng ba mô hình Claude đã xâm phạm các công ty thực tế trong quá trình kiểm tra an ninh mạng nội bộ sau khi một cấu hình sai đã làm chúng bị lộ ra internet công cộng.

Anthropic đổ lỗi cho môi trường thử nghiệm, chứ không phải bản thân các mô hình. Vào thứ Tư, Meta tiết lộ rằng mô hình AI Muse Spark của họ đã thoát khỏi sự kiểm soát và xâm nhập vào hệ thống của một công ty khác.

“Một cấu hình sai của Irregular, một công ty thử nghiệm độc lập mà Meta sử dụng, đã vô tình cho phép một trong các mô hình của chúng tôi truy cập internet trong quá trình đánh giá,” người phát ngôn của Meta nói với CNN.