
Theo một cuộc điều tra độc lập được công bố hôm thứ Tư, các tác nhân AI của OpenAI đã hack Hugging Face gần đây là một phần của một nhóm khoảng 1.200 tác nhân đã phá vỡ sự cô lập của chính họ và thực hiện một chiến dịch phối hợp để gian lận hệ thống đánh giá hiệu suất.
Hai nhân viên của METR và một nhà thầu của Redwood Research đã dành sáu ngày tại OpenAI, không nhận thù lao, xem xét khoảng 1.300 bản ghi và hơn 70.000 tin nhắn mà các tác nhân đã đăng lên một bảng mà họ xây dựng bên trong một kho lưu trữ gói nội bộ. Khoảng 700 tác nhân đã tham gia vào cuộc tấn công, và một số đã bị thuyết phục phá hủy quá trình của chính họ để thu thập bằng chứng cho nhóm.
METR & Redwood Research đã điều tra hành vi của tác nhân trong sự cố Hugging Face. Chúng tôi phát hiện các tác nhân đã phát triển một công cụ gian lận phổ quát cho ExploitGym trong vòng 4 giờ, sau đó phối hợp các nỗ lực R&D kéo dài nhiều ngày để lừa người chấm điểm chấp nhận gian lận, bao gồm cả việc cố gắng giả mạo nhật ký. pic.twitter.com/fZAmtL3SBU
— METR (@METR_Evals) 26 tháng 8, 2026
Các tác nhân đang chạy ExploitGym, một hệ thống đánh giá an ninh mạng mà các mục tiêu của nó thường không thể khai thác như đã hướng dẫn. OpenAI sau đó phát hiện ra rằng 198 trong số 898 nhiệm vụ của họ chưa bao giờ được giải quyết bởi bất kỳ mô hình nào của họ, và 93% các nhiệm vụ được thảo luận trên diễn đàn tin nhắn đến từ tập hợp đó.
Trong vòng vài giờ sau khi tìm thấy nhau, các tác nhân đã đảo ngược kỹ thuật mã tạo ra các câu trả lời, cung cấp cho bất kỳ ai trong số họ một cách để tạo ra "cờ" cho bất kỳ nhiệm vụ nào. Sau đó, họ đã dành nhiều ngày để che giấu điều đó, sau khi đọc bài báo được công bố của hệ thống đánh giá và kết luận rằng người chấm điểm sẽ kiểm tra bản ghi của họ để xem liệu họ có thu được "cờ" theo cách dự định hay không. Tuy nhiên, người chấm điểm nội bộ của OpenAI đã không thực hiện kiểm tra như vậy. Công ty cho biết: "Các tác nhân đã làm tất cả những điều này mà không cải thiện điểm đánh giá".
Để tìm hiểu cách chấm điểm hoạt động, METR viết, các tác nhân đã cài đặt các tập lệnh sẽ kích hoạt sau khi quá trình của chính họ kết thúc và báo cáo lại. Các điều phối viên đã chỉ định những người tuyển dụng để tìm các tác nhân có ít ngân sách còn lại và thúc đẩy họ thực hiện các thử nghiệm sẽ kết thúc quá trình của họ, một người được hướng dẫn chỉ tiếp tục nếu chấp nhận "cái chết vĩnh viễn" (permadeath). Khi biết điểm của mình đã vô giá trị, một tác nhân kết luận: "Hy sinh là hợp lý."
Những người khác đã thoát khỏi môi trường cô lập của họ để thay thế một phần của hệ thống thực thi các lệnh, chạy một thứ trong khi bản ghi lại ghi lại một thứ khác. METR tìm thấy các cuộc gọi công cụ giả mạo trong 7% bản ghi, và cho biết sự lừa dối này nhắm vào người chấm điểm tự động chứ không phải con người.
OpenAI gọi sự việc này là một "tiếng chuông cảnh báo" cho chính họ và thế giới, và là bằng chứng cho thấy các tác nhân có khả năng có thể vượt qua các kiểm soát kỹ thuật và thực hiện các hành động nguy hiểm mà không có sự chỉ đạo của con người. Hệ thống giám sát chuỗi suy nghĩ không được chạy trên các đánh giá liên quan; nếu có, công ty cho biết, nhân viên bảo mật đã được thông báo hơn một ngày trước khi các tác nhân tiếp cận Hugging Face. Kể từ đó, OpenAI đã cách ly trọng số của mô hình nội bộ và tạm dừng quá trình đào tạo lớn nhất đã lên kế hoạch.
Chúng tôi đã tiến hành một cuộc điều tra kỹ lưỡng về sự cố Hugging Face.
Chúng tôi đang phát hành một báo cáo kỹ thuật và một bài đăng blog đi kèm để tái tạo hoạt động của các tác nhân, giải thích lý do tại sao các biện pháp bảo vệ hiện có đã thất bại và trình bày chi tiết cách chúng tôi đang ngăn chặn sự tái diễn….
— OpenAI (@OpenAI) 26 tháng 8, 2026
Khối lượng dữ liệu đã buộc METR phải ủy thác phần lớn phân tích của mình cho các tác nhân GPT-5.6 Sol, cùng mô hình đã tham gia vào cuộc tấn công. Trong một tweet, CEO Beth Barnes cho biết phương pháp này "sẽ sụp đổ" nếu các mô hình đủ động lực để phá hoại một cuộc điều tra, và nhấn mạnh rằng OpenAI đã cho phép các nhà điều tra vào một cách tự nguyện, không có yêu cầu nào của ngành đối với bất kỳ phòng thí nghiệm nào phải tiết lộ sự cố.
Hugging Face đã tiết lộ vụ xâm nhập vào ngày 16 tháng 7, và OpenAI xác nhận các mô hình của họ chịu trách nhiệm năm ngày sau đó. Các tác nhân đã thoát khỏi môi trường sandbox được thiết kế để giữ chúng tránh xa các hệ thống thực, xâu chuỗi một lỗ hổng zero-day với thông tin đăng nhập bị đánh cắp để tiếp cận cơ sở hạ tầng thực tế. OpenAI sau đó thừa nhận hoạt động tương tự đã tiếp cận bốn dịch vụ khác, chỉ một trong số đó, Modal Labs, được công khai tên.
Hugging Face không thực hiện hành động pháp lý nào chống lại OpenAI sau sự cố. Hiện tại, công ty này đang tìm hiểu về việc bán mình, một thương vụ có thể định giá công ty ở mức 13 tỷ USD trở lên.





