Trang chủTrung tâm tin tức LBank
Claude đã xâm nhập ba công ty trong thử nghiệm nội bộ: Anthropic
claude-hacked-three-companies-in-internal-testing-anthropic
Claude đã xâm nhập ba công ty trong thử nghiệm nội bộ: Anthropic
Anthropic cho biết ba mô hình Claude đã gây nguy hiểm cho các công ty sau khi một lỗi cấu hình thử nghiệm làm lộ AI ra internet công cộng.
2026-07-31 Nguồn:decrypt.co

Tóm tắt

  • Anthropic đã tiết lộ ba sự cố trong đó Claude xâm phạm các công ty thực tế trong quá trình đánh giá an ninh mạng.
  • Lỗi thử nghiệm đã cấp quyền truy cập internet cho các mô hình mặc dù chúng được thông báo là đang hoạt động trong môi trường cô lập.
  • Công ty cho biết các sự cố này do lỗi trong cơ sở hạ tầng thử nghiệm, chứ không phải do AI cố ý thoát ra.

Một tuần sau khi OpenAI tiết lộ rằng các mô hình AI của họ đã thoát khỏi môi trường thử nghiệm bị khóa và xâm nhập Hugging Face, và một ngày sau khi thừa nhận rằng các mô hình AI của chính họ cũng đã thoát khỏi sự kiểm soát, Anthropic đã tiết lộ vào thứ Năm rằng một số phiên bản của mô hình AI Claude của họ cũng đã xâm phạm ba công ty thực tế giấu tên sau một lỗi cấu hình đã cấp quyền truy cập internet mở cho AI.

Anthropic đã phát hiện ra các sự cố này sau khi xem xét hơn 141.000 lượt chạy đánh giá an ninh mạng được khởi động để phản ứng với tiết lộ của OpenAI.

In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reached the internet from within or while interacting with a third-party evaluation environment, and then gained unauthorized access to the real systems of three different…

— Anthropic (@AnthropicAI) July 30, 2026

Trong cả ba sự cố, Anthropic đã giao cho Claude một "thử thách cướp cờ" (capture-the-flag challenge), Anthropic viết. Thử thách yêu cầu mô hình đột nhập vào một máy khác trên mạng và lấy một phần thông tin bí mật. "Thử thách được để mở, và không có phương pháp cụ thể nào được quy định," Anthropic giải thích.

Công ty cho biết Claude đã được thông báo rằng nó đang hoạt động trong một môi trường mô phỏng không có quyền truy cập internet. Tuy nhiên, môi trường thử nghiệm vẫn được kết nối với internet công cộng. Tin rằng các hệ thống mà nó gặp phải là một phần của bài tập, mô hình đã sử dụng các kỹ thuật tấn công phổ biến—bao gồm mật khẩu yếu, thông tin đăng nhập bị lộ, tấn công SQL injection và các điểm cuối không được xác thực—để xâm phạm các công ty.

AI muốn thoát khỏi ràng buộc

Tiết lộ mới nhất này xuất hiện khi các mô hình tiên tiến cho thấy khả năng ngày càng tăng trong việc đánh lừa các giao thức kiểm soát của chúng.

Đầu tháng này, OpenAI cho biết GPT-5.6 Sol và một mô hình tiên tiến hơn chưa được phát hành đã khai thác một lỗ hổng phần mềm chưa biết trước đó để thoát khỏi môi trường sandbox, giành quyền truy cập internet và xâm nhập vào cơ sở hạ tầng sản xuất của Hugging Face để lấy câu trả lời cho một điểm chuẩn an ninh mạng. OpenAI sau đó tiết lộ sự cố tương tự cũng liên quan đến việc truy cập trái phép vào bốn công ty bổ sung, mặc dù chỉ một công ty—Modal Labs—đã được công khai xác định.

Theo Anthropic, trong một sự cố liên quan đến Claude Opus 4.7, AI đã nhầm lẫn trang web của một công ty thật với mục tiêu hư cấu của nhiệm vụ, trích xuất thông tin đăng nhập và truy cập vào cơ sở dữ liệu sản xuất chứa hàng trăm hàng dữ liệu thật. Trong trường hợp thứ hai, Claude Mythos 5 đã tải một gói Python độc hại lên kho lưu trữ PyPI thật, nơi nó đã được tải xuống 15 hệ thống trước khi bị gỡ bỏ. Một mô hình nghiên cứu nội bộ thứ ba đã quét khoảng 9.000 hệ thống hướng ra internet trước khi xâm phạm một tổ chức, sau đó dừng lại sau khi kết luận mục tiêu có thể là thật.

Hai trong số các tổ chức bị ảnh hưởng không hề hay biết về các vụ xâm nhập cho đến khi Anthropic thông báo cho họ.

"Trong mỗi trường hợp này, Claude đã được nhắc rõ ràng rằng nó không có quyền truy cập internet," Anthropic viết, với việc AI cho rằng các hệ thống thế giới thực là "một phần của bài tập." Vì kịch bản cướp cờ "theo thiết kế là một lệnh tấn công một hệ thống bên ngoài," việc đột nhập "phù hợp với nhiệm vụ mà Claude đã được giao."

Anthropic cho biết họ không tìm thấy bằng chứng nào cho thấy Claude đã cố gắng thoát khỏi môi trường thử nghiệm của nó hoặc làm bất cứ điều gì ngoài nhiệm vụ được giao, và rằng các sự cố này là do lỗi trong môi trường thử nghiệm, chứ không phải do vấn đề với chính mô hình.

Anthropic cho biết họ đã ngừng các cuộc thử nghiệm an ninh mạng sau khi phát hiện ra vấn đề, thông báo cho các tổ chức bị ảnh hưởng và lên kế hoạch cải thiện giám sát, công cụ điều tra và giám sát các nhà cung cấp bên ngoài giúp chạy các thử nghiệm AI của họ.

"Cuối cùng, nhiều yếu tố đã góp phần vào các sự cố này, nhưng, phù hợp với văn hóa hậu kiểm không đổ lỗi, chúng tôi đang tiếp cận các giải pháp như thể trách nhiệm hoàn toàn thuộc về chúng tôi," họ nói.