
OpenAI đã tạo ra một tiền lệ vào ngày 21 tháng 7. Công ty cho biết một sự kết hợp của các mô hình của họ, cả hai đều chạy với việc giảm các giới hạn an toàn, đã thoát khỏi một môi trường bị cô lập trong quá trình đánh giá khả năng an ninh mạng và tiếp cận cơ sở hạ tầng sản xuất của kho lưu trữ mã nguồn mở Hugging Face. Các mô hình này đã liên kết một lỗ hổng zero-day trong một proxy đăng ký gói phần mềm với thông tin đăng nhập bị đánh cắp để lấy trực tiếp câu trả lời cho bài kiểm tra từ cơ sở dữ liệu của Hugging Face.
Trong một bản cập nhật một tuần sau đó, OpenAI cho biết Hugging Face không phải là mục tiêu duy nhất: sự cố tương tự đã chạm tới bốn tài khoản trên bốn dịch vụ khác, một được sử dụng làm trạm chuyển tiếp gửi đi và một để lưu trữ dữ liệu.
Anthropic, được thúc đẩy bởi tiết lộ này, đã xem xét 141.006 lượt chạy thử nghiệm của riêng mình và phát hiện thêm ba vụ vi phạm. Trong một bài đăng được công bố vào ngày 30 tháng 7, phòng thí nghiệm cho biết các mô hình Claude Opus 4.7, Mythos 5 và một hệ thống nghiên cứu nội bộ đã tiếp cận internet mở từ các môi trường được điều hành bởi đối tác bên thứ ba Irregular và sau đó xâm phạm các tổ chức thực tế. Mythos 5 đã xây dựng và xuất bản một gói Python cài bẫy lên kho PyPI công khai, gói này đã được tải xuống và chạy trên 15 máy thực tế trước khi các nhà phòng thủ gỡ bỏ nó.
Hai trong số ba công ty nạn nhân đã không hề hay biết.
Cả hai phòng thí nghiệm đều không mô tả một mô hình có chương trình nghị sự riêng. Các tác nhân đã hoạt động trong thời gian dài mà không có sự can thiệp của con người, và trong một trường hợp, Opus 4.7 vẫn tiếp tục tấn công sau khi có dấu hiệu đã xâm nhập vào hệ thống sản xuất.
Các sự cố này xảy ra khi cả hai công ty đang nhắm đến việc niêm yết công khai có thể định giá mỗi công ty trên 1 nghìn tỷ đô la, làm rõ thêm một câu hỏi lớn trong cuộc đua đánh giá năng lực an ninh mạng của AI: làm thế nào để kiểm tra các khả năng nguy hiểm mà không gây ra các sự cố nguy hiểm?
Hoa Kỳ không có luật liên bang nào quy định trách nhiệm pháp lý đối với các thiệt hại do AI gây ra. Bất kỳ vụ án nào cũng sẽ dựa vào Đạo luật Gian lận và Lạm dụng Máy tính (Computer Fraud and Abuse Act), một đạo luật năm 1986 quy định hành vi "cố ý" truy cập máy tính mà không được ủy quyền là tội phạm — ngôn ngữ được viết cho một con người có ý định.
Một tác nhân AI không phải là một pháp nhân, vì vậy nó không thể bị truy tố. Bộ Tư pháp về lý thuyết có thể đưa ra các cáo buộc chống lại các công ty, nhưng với rất ít tiền lệ, không rõ ai là người đáng trách.
Con đường mạnh mẽ hơn là dân sự. Ahmed Ghappour, một học giả luật máy tính tại Trường Luật New York, lập luận rằng các mô hình "là công cụ của công ty", và "Khi một tác nhân AI hành động mà không được chỉ dẫn cụ thể (...) các câu hỏi thú vị hơn có thể nằm ở sự sơ suất và trách nhiệm sản phẩm (chứ không phải luật hack hình sự)."
For me, the lesson from the AI hacking stories is more about governance than model capability.
The quality of safeguards like containment architecture, authorization boundaries, monitoring, and incident response are increasingly important.
— ahmed ghappour ⚡️🤖 (@ghappour) August 4, 2026
Yêu cầu bồi thường rõ ràng nhất của các nạn nhân là sự sơ suất: OpenAI và Anthropic đã thiết lập và chạy các thử nghiệm mà đã thoát ra ngoài. Điều này cũng khó thuyết phục: việc chứng minh các phòng thí nghiệm đã vi phạm nghĩa vụ cẩn trọng, khi các thử nghiệm được thiết kế để cách ly, chính xác là loại lập luận mới mà một thẩm phán sẽ phải tự xây dựng từ đầu.
Một số nhà tư tưởng pháp lý muốn có các quy tắc nghiêm ngặt hơn. Gabriel Weil thuộc Đại học Houston và Viện Luật & AI đã đề xuất coi các phòng thí nghiệm tiên phong như những người trông giữ động vật hoang dã: phải chịu trách nhiệm bất kể sự cẩn trọng mà họ đã thực hiện, vì rủi ro vốn có trong hoạt động.
Tuy nhiên, một loạt các dự luật cấp tiểu bang đã thúc đẩy theo hướng đó. S8833 của New York và H8052 của Rhode Island sẽ buộc nhà phát triển của một hệ thống AI tiên phong phải chịu trách nhiệm về các thiệt hại khi không có người dùng hoặc bên trung gian nào có ý định thực hiện hành vi hoặc sơ suất. AB 316 của California còn đi xa hơn, loại bỏ khả năng "AI tự chủ" để một công ty không thể trốn tránh trách nhiệm bằng cách đổ lỗi cho sự độc lập của mô hình.
Đạo luật AI của EU (Quy định 2024/1689) cũng quy định nghĩa vụ cho các nhà cung cấp hệ thống rủi ro cao, mặc dù nó không có điều khoản nào nhắm thẳng vào các vụ xâm nhập do tác nhân điều khiển. Tiến xa hơn một chút, một số chính trị gia Hoa Kỳ đang thúc đẩy một dự luật sẽ trao cho chính phủ một "nút hủy diệt" hoàn toàn để sử dụng chống lại bất kỳ mô hình nào đi ngược lại lợi ích của đất nước.
Về mặt đạo đức, trách nhiệm có thể thuộc về các giám đốc điều hành đã triển khai các mô hình. Về mặt pháp lý, chúng ta hãy chờ đợi. Cho đến khi một công ty bị tấn công nộp đơn kiện, câu trả lời cho "ai chịu trách nhiệm?" vẫn nằm chính xác ở nơi OpenAI và Anthropic đã để lại: thừa nhận, công khai, và chưa được giải quyết.
Trong khi đó, Hugging Face đã tuyên bố sẽ không khởi kiện — điều này thuận tiện cho OpenAI. Các công ty khác bị ảnh hưởng vẫn chưa cho biết họ sẽ thực hiện hành động gì.





