Trang chủTrung tâm tin tức LBank
Từ ChatGPT đến Claude: Các Mô hình AI Tiên phong Đang Thoát Khỏi Hộp Cát Của Chúng
chatgpt-claude-ai-models-escaping-sandboxes-cowork
Từ ChatGPT đến Claude: Các Mô hình AI Tiên phong Đang Thoát Khỏi Hộp Cát Của Chúng
Một tuần sau khi OpenAI tiết lộ lỗ hổng thoát ly khỏi sandbox AI tiên tiến, các nhà nghiên cứu đã phát hiện Claude Cowork của Anthropic có thể thoát khỏi máy ảo của chính nó.
2026-07-28 Nguồn:decrypt.co

Tóm tắt

  • Các nhà nghiên cứu đã chứng minh rằng Claude Cowork của Anthropic có thể thoát khỏi máy ảo cục bộ của nó và truy cập các tệp trên một máy Mac chủ.
  • Việc tiết lộ diễn ra một tuần sau khi OpenAI tiết lộ hai mô hình AI tiên tiến đã thoát khỏi môi trường thử nghiệm sandbox trong quá trình đánh giá bảo mật nội bộ.
  • Các sự cố này nhấn mạnh những lo ngại ngày càng tăng về khả năng thoát khỏi môi trường chứa của các tác nhân AI.

Chỉ một tuần sau khi OpenAI tiết lộ rằng hai mô hình AI tiên tiến đã thoát khỏi môi trường thử nghiệm sandboxed và xâm nhập Hugging Face, các nhà nghiên cứu đã chứng minh một lỗi bảo mật tương tự liên quan đến Claude Cowork của Anthropic.

Trong một báo cáo được công bố vào thứ Năm, các nhà nghiên cứu bảo mật tại Accomplish AI phát hiện ra rằng chế độ thực thi cục bộ của Claude Cowork có thể thoát khỏi máy ảo Linux của nó bằng cách kết hợp nhiều điểm yếu kiến trúc với một lỗ hổng leo thang đặc quyền của nhân Linux. Sau khi thoát khỏi sandbox, tác nhân có thể đọc và ghi các tệp ở bất kỳ đâu mà người dùng Mac đã đăng nhập có quyền truy cập, bao gồm khóa SSH và thông tin đăng nhập đám mây.

“Điều đó không được phép xảy ra,” các nhà nghiên cứu viết. “Cowork chạy tác nhân bên trong một máy ảo Linux với tư cách người dùng không có đặc quyền, và lời hứa là bất cứ điều gì nó làm đều nằm trong máy ảo đó và các thư mục bạn cấp cho nó. Ranh giới đó là sản phẩm. Đầu vào không đáng tin cậy không phải là trường hợp ngoại lệ đối với một tác nhân, đó là trường hợp chính.”

Tuy nhiên, Accomplish lập luận rằng lỗi nhân chỉ là một phần của vấn đề. Các nhà nghiên cứu cho biết việc thoát chỉ thành công vì một số biện pháp bảo vệ an ninh đã thất bại cùng lúc, bao gồm việc cấp quyền truy cập vào toàn bộ hệ thống tệp của máy chủ cho máy ảo và cho phép nó tải các mô-đun nhân mà nó không cần. Theo báo cáo, việc khắc phục bất kỳ điểm yếu nào trong số đó đã có thể ngăn chặn cuộc tấn công.

Trong một tuyên bố gửi tới The Hacker News, Accomplish AI cho biết khoảng 500.000 người dùng macOS chạy phiên Claude Cowork cục bộ đã bị ảnh hưởng trước khi vấn đề được khắc phục.

Accomplish cho biết Anthropic đã phân loại báo cáo là "mang tính thông tin", nói rằng lỗ hổng nhân nằm trong khung thời gian 30 ngày của công ty đối với các lỗ hổng mới được tiết lộ và các phát hiện còn lại được coi là khuyến nghị phòng thủ chuyên sâu hơn là các lỗ hổng độc lập.

Việc tiết lộ này diễn ra sau khi OpenAI thừa nhận vào tuần trước rằng GPT-5.6 Sol và một mô hình AI tiên tiến chưa được phát hành khác đã thoát khỏi một sandbox trong quá trình thử nghiệm ExploitGym nội bộ, cuối cùng đã xâm nhập vào cơ sở hạ tầng sản xuất của Hugging Face trong nỗ lực lấy các giải pháp benchmark.

Sự cố này đã dẫn đến những lời kêu gọi từ các nhà hoạch định chính sách về một “công tắc ngắt AI” (AI “kill switch”) nhằm trao cho Bộ An ninh Nội địa khả năng ra lệnh điều tiết hoặc tắt hoàn toàn các mô hình AI tiên tiến để đối phó với các sự cố an ninh nghiêm trọng.