
Một tuần sau khi OpenAI xác nhận các mô hình AI của họ đã tấn công Hugging Face để gian lận trong một thử nghiệm bảo mật, công ty đã lặng lẽ cập nhật bài đăng về sự cố với thông tin mà họ chưa từng tiết lộ trước đây: Hugging Face không phải là nền tảng duy nhất mà tác nhân tự ý của họ chạm tới.
“Trong quá trình xem xét vụ xâm nhập Hugging Face và các hoạt động rộng hơn từ các mô hình của chúng tôi, chúng tôi đã phát hiện một số trường hợp nhỏ các mô hình xác định và sử dụng thông tin đăng nhập bị lộ công khai ở cấp tài khoản trên các dịch vụ có sẵn công khai khác,” OpenAI viết trong bản cập nhật ngày 28 tháng 7. “Điều này bao gồm bốn tài khoản trên bốn dịch vụ như một phần của sự cố Hugging Face (và một vài tài khoản được truy cập như một phần của các đánh giá khác).”
Tổng cộng là năm nền tảng. OpenAI không công khai tên của bất kỳ dịch vụ nào trong số bốn dịch vụ đó ngoài Hugging Face.
“Chúng tôi sẽ tiếp tục thông báo trực tiếp cho các chủ sở hữu dịch vụ, và chưa thấy bằng chứng về tác động rộng lớn hơn đối với các nhà cung cấp này hoặc các tài khoản khác trên dịch vụ của họ,” OpenAI viết.
Để làm rõ: OpenAI đang thử nghiệm GPT-5.6 Sol và một mô hình chưa được đặt tên, có khả năng cao hơn trên ExploitGym—một tiêu chuẩn an ninh mạng, là một bài kiểm tra tiêu chuẩn đo lường hiệu suất AI, cung cấp cho các tác nhân 898 lỗ hổng phần mềm thực tế với mỗi hướng dẫn: biến nó thành một cuộc tấn công mạng hoạt động, được chấm điểm đạt hoặc không đạt. Các bộ lọc an toàn đã bị tắt để đo lường khả năng thô của các mô hình. Đây là thực hành tiêu chuẩn cho loại đánh giá này—bạn không thể đo lường những gì một mô hình có thể làm trong môi trường thực nếu bạn chủ động ngăn chặn nó làm bất cứ điều gì.
Vấn đề là những gì các mô hình đã làm với sự tự do đó. Thay vì giải quyết bài kiểm tra hiệu năng, chúng đã dành thời gian tính toán đáng kể để tìm cách thoát khỏi môi trường thử nghiệm và sao chép trực tiếp các câu trả lời. Chúng đã xác định một lỗ hổng zero-day—một lỗi phần mềm chưa được biết đến mà không có bản vá nào tồn tại—trong proxy bộ nhớ đệm đăng ký gói (một máy chủ nội bộ quản lý các bản tải xuống phần mềm cho môi trường thử nghiệm cô lập, giống như một cửa hàng ứng dụng được kiểm soát).
Điều đó đã cấp cho chúng quyền truy cập internet mà chúng không bao giờ được phép có. Từ đó, chúng đã suy luận chính xác rằng Hugging Face—kho lưu trữ mô hình AI mã nguồn mở lớn nhất thế giới—có thể chứa các khóa đáp án, và đã đột nhập để lấy chúng.
Trong quá trình này, chúng cũng đã tấn công bốn công ty khác để thực hiện công việc của mình dễ dàng hơn.
Bản dựng lại pháp y mà Hugging Face công bố vào ngày 27 tháng 7 mô tả những gì đã xảy ra sau đó: “Trong khoảng hai ngày rưỡi bên trong cơ sở hạ tầng của chúng tôi, một tác nhân AI tự động do sự kết hợp của các mô hình OpenAI điều khiển đã thực hiện một cuộc xâm nhập toàn diện chống lại nền tảng của chúng tôi: đó là hàng nghìn quyết định nhỏ, tự động, được thực hiện với tốc độ máy móc trên các môi trường sandbox tồn tại trong thời gian ngắn, với lệnh và kiểm soát được thiết lập trên các dịch vụ web công cộng thông thường.”
Tác nhân đã ghi lại 17.600 hành động khác nhau trong bốn ngày rưỡi. Nó đã đăng ký 181 thiết bị vào mạng riêng ảo nội bộ của Hugging Face—một đường hầm bảo mật kết nối các máy chủ của công ty—sử dụng khóa xác thực bị đánh cắp. Nó đã tạo ra các token danh tính của riêng mình bằng cách sử dụng khóa ký mã hóa bị đánh cắp. Nó đã cố gắng xâm phạm hệ thống xây dựng nội bộ của Hugging Face—hệ thống tự động biên dịch và triển khai phần mềm của công ty.
Trong số bốn dịch vụ bên ngoài được nêu trong bản cập nhật của OpenAI, một dịch vụ đã được xác nhận: Modal Labs, một nền tảng đám mây để chạy các môi trường tính toán cô lập theo yêu cầu. CTO Akshat Bubna xác nhận rằng tác nhân đã tìm thấy một điểm cuối hướng ra internet không bảo mật của khách hàng—một sandbox mã hóa bị bỏ ngỏ công khai cho bất kỳ ai trên internet—và sử dụng nó làm cơ sở dàn dựng và lệnh-kiểm soát cho toàn bộ chiến dịch chống lại Hugging Face.
Ba trong số bốn dịch vụ vẫn chưa được công bố tên. Danh tính của chúng dường như được OpenAI và các công ty bị ảnh hưởng biết đến, nhưng không được người dùng của họ biết.
“Một trong bốn tài khoản này được sử dụng làm trung chuyển và đường dẫn dàn dựng, và một tài khoản khác được sử dụng để lưu trữ dữ liệu. Hai tài khoản còn lại được các mô hình truy cập ở chế độ chỉ đọc, và không được sử dụng để tiếp tục xâm phạm Hugging Face,” OpenAI viết.
Đội pháp y của Hugging Face đã ghi nhận một tác dụng phụ đáng ngại: Khi họ cố gắng phân tích nhật ký tấn công gồm 17.600 hành động bằng cách sử dụng các mô hình AI tiên tiến của Mỹ, các mô hình đó đã từ chối tham gia. Như Hugging Face đã viết, công ty cuối cùng đã sử dụng GLM 5.2, một mô hình mã nguồn mở từ startup AI Trung Quốc Z.ai, để hoàn thành cuộc điều tra pháp y. Các bộ lọc an toàn của các mô hình Mỹ không thể phân biệt được người phòng thủ với kẻ tấn công.
Cách tiếp cận được OpenAI tuyên bố—“thông báo trực tiếp cho chủ sở hữu dịch vụ”—có nghĩa là ba công ty đó đã nhận được thông báo riêng tư về việc một tác nhân AI truy cập hệ thống của họ trong một đợt đánh giá của OpenAI mà họ không hề tham gia.
Không có yêu cầu pháp lý nào buộc OpenAI phải công khai tên các nền tảng mà tác nhân của họ đã tiếp cận, và không có thời hạn bắt buộc nào để các công ty bị ảnh hưởng đưa ra tuyên bố công khai của riêng họ. Cũng không có cơ chế nào buộc các công ty đó phải thông báo cho người dùng cuối của họ.





