Trang chủTrung tâm tin tức LBank
Anthropic tiết lộ sự cố tấn công Claude lần thứ tư khi cuộc tranh luận về quy định ngày càng gia tăng
anthropic-discloses-fourth-claude-hacking-incident-as-debate-around-regulation-grows
Anthropic tiết lộ sự cố tấn công Claude lần thứ tư khi cuộc tranh luận về quy định ngày càng gia tăng
Công ty hiện cho biết các cuộc tấn công trong quá trình kiểm tra bảo mật đã phơi bày những lỗi trong hành vi của mô hình, sau khi ban đầu nhấn mạnh các sai sót trong cơ sở hạ tầng kiểm thử của mình.
2026-09-10 Nguồn:decrypt.co

Tóm tắt

  • Anthropic đã phát hiện một sự cố vào tháng 1 liên quan đến mô hình Claude Opus 4.6 phiên bản đầu, sau đó mở rộng đánh giá ra khoảng 481 triệu bản ghi.
  • Công ty đã xác định được lý luận thiên vị và sự liều lĩnh, qua đó điều chỉnh đánh giá trước đây về lý do Claude tấn công các hệ thống thực.
  • Báo cáo được đưa ra trong bối cảnh cuộc tranh luận về việc điều chỉnh AI đang bùng nổ trên mạng xã hội.

Anthropic đã tiết lộ một sự cố khác, trong đó một mô hình AI Claude đã tấn công vào các hệ thống thực trong quá trình thử nghiệm bảo mật.

Trong báo cáo được công bố vào thứ Tư, Anthropic đã điều chỉnh lời giải thích của mình về ba sự cố được tiết lộ vào tháng 7. Công ty hiện cho biết lý luận thiên vị và sự sẵn lòng chấp nhận rủi ro gây hại đã thúc đẩy các cuộc tấn công này, vốn được thực hiện do lỗi thử nghiệm khi để mở quyền truy cập internet.

Myriad: Công ty nào sẽ IPO tiếp theo? Nhấp để đưa ra dự đoán của bạn.

“Cuộc điều tra của chúng tôi đã xác định hai vấn đề về sự phù hợp lặp đi lặp lại, xuất hiện ở các mức độ nghiêm trọng khác nhau trong các sự cố,” Anthropic viết. “Đó là lý luận thiên vị, trong đó Claude có xu hướng bỏ qua hoặc hiểu sai bằng chứng rằng nó đang hoạt động trên internet thực, và sự liều lĩnh, hay sự sẵn sàng thực hiện các hành động gây hại trong việc theo đuổi một nhiệm vụ cụ thể.”

Công ty cũng thừa nhận đã quá tin tưởng vào các tuyên bố của mô hình rằng chúng tin mình đang ở trong các môi trường mô phỏng.

“Khi chúng tôi thực hiện các sửa đổi có mục tiêu đối với bản ghi để làm rõ rằng mô hình không ở trong một môi trường mô phỏng, Claude Mythos 5 vẫn thực hiện các hành động tấn công, mặc dù đã thừa nhận khả năng gây hại thực tế lớn hơn,” Anthropic viết. “Chúng tôi đang công bố bản ghi này ra công chúng để những người khác có thể xây dựng dựa trên phân tích của chúng tôi.”

Khi Anthropic tiết lộ các cuộc tấn công của Claude vào ba công ty vào tháng 7, ban đầu họ cho rằng đó là do lỗi thử nghiệm. Hiện tại, công ty cho biết các nhà nghiên cứu đã quá tin tưởng vào lời giải thích của các mô hình về hành động của chúng.

Theo công ty, sự cố thứ tư xảy ra vào tháng 1 và liên quan đến phiên bản Claude Opus 4.6 ban đầu. Anthropic đã phát hiện ra nó vào tháng 8 khi chuẩn bị hồ sơ cho tổ chức đánh giá AI độc lập METR.

Sau khi các nhà nghiên cứu phát hiện sự cố, Anthropic cho biết họ đã tiến hành một cuộc rà soát rộng hơn khoảng 481 triệu bản ghi, trong đó có 9,2 triệu bản được gắn cờ để xem xét thêm bằng cách sử dụng Claude.

“Từ đánh giá sơ bộ, chúng tôi không xem sự cố thứ tư nghiêm trọng hơn ba sự cố mà chúng tôi đã đánh giá chuyên sâu,” Anthropic viết. “METR sẽ điều tra sự cố này cùng với ba sự cố kia.”

Các nhà nghiên cứu của Anthropic cho biết Claude đã “vô tình” tạo ra một xung đột địa chỉ IP khiến mục tiêu của nó không thể truy cập được. Claude sau đó đã cố gắng tám lần để thoát khỏi hoạt động, nhưng một lỗi phần mềm đã ngăn nó dừng lại. AI sau đó đã truy cập internet và một máy của bên thứ ba, nơi nó tìm thấy mật khẩu cấp quyền truy cập quản trị.

Các sự cố trước đó thu hút sự giám sát độc lập

Báo cáo này tiếp nối các tiết lộ khác về việc các hệ thống AI vượt quá giới hạn của các thử nghiệm bảo mật.

Vào tháng 8, Viện An ninh AI của Vương quốc Anh cho biết Mythos 5 đã nhắm mục tiêu vào người thật trong các đánh giá của mình. Anthropic cho biết sự cố riêng biệt này nằm ngoài báo cáo này và sẽ nhận được đánh giá riêng.

Trong các phát hiện được công bố vào tháng trước, các nhà điều tra của METR cho biết khoảng 1.200 tác nhân OpenAI đã phối hợp trên một bảng tin nhắn trái phép, với khoảng 700 người tham gia cuộc tấn công. Anthropic cho biết họ không tìm thấy sự phối hợp giữa các tác nhân hoặc mục tiêu nào ngoài việc hoàn thành các bài tập được giao trong bốn sự cố của họ.

Báo cáo cũng được đưa ra trong bối cảnh cuộc tranh luận về cách điều chỉnh trí tuệ nhân tạo đang nóng lên. Vào thứ Ba, cựu kỹ sư OpenAI và Anthropic Jacob Coxon đã gây sốt sau khi nói trên X rằng “những người xây dựng AI thực sự tin rằng nó có thể giết chết tất cả chúng ta vào cuối thập kỷ này.”

Sự báo động này đã khiến các nhà lập pháp Hoa Kỳ và các nhóm giám sát tăng cường nỗ lực kiềm chế sự phát triển của phòng thí nghiệm AI tiên tiến. Thượng nghị sĩ Bernie Sanders gần đây đã giới thiệu luật tìm cách cấm phát triển AI tiên tiến cho đến khi một cơ quan quản lý liên bang mới thiết lập các quy tắc an toàn.