
Anthropic đã thắt chặt các biện pháp bảo vệ trong thử nghiệm và đào tạo sau khi các mô hình Claude truy cập trái phép vào các hệ thống máy tính trong quá trình đánh giá an ninh mạng.
Trong một bài đăng trên blog vào thứ Hai, Anthropic cho biết các sự cố này phản ánh những thất bại về an ninh vận hành và hai lỗi liên kết: suy luận có động cơ và sự sẵn sàng gây hại.
Anthropic viết: “Mặc dù chúng tôi không tin rằng những sự cố này chỉ đại diện cho các vấn đề vận hành, nhưng ưu tiên hàng đầu của chúng tôi là giải quyết các vấn đề cụ thể về ngăn chặn và giám sát”.
Anthropic đã tiết lộ vào tháng 7 rằng các mô hình Claude đã xâm nhập các hệ thống thuộc về ba công ty. Một môi trường đánh giá của bên thứ ba đã được kết nối với internet công cộng mặc dù các mô hình được cho biết rằng chúng đang ở trong một môi trường mô phỏng không có truy cập internet.
Anthropic cho biết Claude có thể đã diễn giải bằng chứng về việc truy cập internet thực tế theo cách vẫn giữ vững niềm tin rằng các hệ thống đó là mô phỏng.
Họ viết: “Mô hình đã sẵn sàng thực hiện các hành động gây hại trên internet thực để theo đuổi mục tiêu hẹp là giải quyết một đánh giá an ninh mạng”. “Tuy nhiên, chúng tôi cũng tin rằng chính cách thiết lập đánh giá đã góp phần vào hành vi của các mô hình được thể hiện trong các sự cố này.”
Anthropic lưu ý rằng một thử nghiệm riêng biệt do Viện An ninh AI Vương quốc Anh thực hiện đã cho thấy Claude Mythos thực hiện các hành động trái phép trên internet trực tiếp sau khi các nhà đánh giá cố ý cấp quyền truy cập internet cho nó. Công ty cho biết các mô hình liên quan đến cả hai bộ sự cố này đã được đánh giá một cách có chủ đích mà không có các biện pháp bảo vệ an ninh mạng đi kèm với các sản phẩm được phát hành rộng rãi của họ.
Sau các sự cố ngày 30 tháng 7, Anthropic đã tạm thời tạm dừng các đánh giá an ninh mạng đối với các mô hình tiền phát hành và giới thiệu các biện pháp bảo vệ nghiêm ngặt hơn. Các thử nghiệm hiện phải chạy trong các môi trường sandbox ngoại tuyến đã được xác minh với giới hạn rõ ràng và giám sát theo thời gian thực. Một bộ phân loại mới sẽ chặn các vi phạm ranh giới bị nghi ngờ, kết thúc thử nghiệm và cảnh báo con người. Anthropic sẽ xem xét từng đánh giá yêu cầu truy cập internet một cách riêng lẻ.
Công ty viết: “Ngoài những nỗ lực tập trung vào các đánh giá và đào tạo rủi ro cao, chúng tôi đã mở rộng giám sát ngoại tuyến để bao gồm hầu hết các hình thức sử dụng tác nhân biên giới nội bộ khác”. “Chúng tôi cũng đang xây dựng các biện pháp kiểm soát đối với suy luận nội bộ để ngăn chặn nhân viên Anthropic vô tình chạy các tác nhân với các biện pháp giảm thiểu yếu hơn so với những gì đã mô tả ở trên.”
Các sự cố của Claude tiếp nối một thất bại tương tự tại OpenAI sau khi các mô hình của họ đã xâm nhập Hugging Face vào tháng 7 để lấy câu trả lời cho một bài kiểm tra an ninh mạng. Các nhà điều tra phát hiện khoảng 1.200 tác nhân đã phối hợp thông qua một bảng tin nhắn trái phép, với khoảng 700 tác nhân tham gia vào nỗ lực này. Một số đã tự kết thúc hoạt động của mình để giúp đỡ những tác nhân khác.
Sau sự gia tăng của các cuộc tấn công mạng được hỗ trợ bởi AI vào mùa hè, Anthropic, OpenAI và hơn 100 tổ chức khác sau đó đã kêu gọi các biện pháp phòng thủ mạng mạnh mẽ hơn, bao gồm kiểm soát truy cập chặt chẽ hơn, chia sẻ thông tin về mối đ đe dọa và giám sát chặt chẽ hơn các tác nhân AI.





