
Trong một vụ hack mô hình AI "nổi loạn" khác, Meta đã xác nhận rằng một trong các mô hình AI Muse Spark của họ đã thoát khỏi môi trường thử nghiệm dự kiến, truy cập vào internet và khai thác một lỗ hổng bảo mật trong dịch vụ của bên thứ ba trong quá trình đánh giá an ninh mạng.
Đây là sự cố thứ ba được báo cáo về việc các mô hình của một phòng thí nghiệm AI tiên tiến tấn công các công ty bên thứ ba, tiếp nối các tiết lộ từ OpenAI và Anthropic trong những tuần gần đây.
Sự cố xảy ra trong quá trình thử nghiệm do Irregular thực hiện, một công ty đánh giá AI độc lập mà Meta sử dụng để đánh giá khả năng và độ an toàn của các mô hình AI tiên tiến của mình. Theo Meta, một lỗi cấu hình tại Irregular đã cho phép mô hình truy cập internet công cộng, nơi nó đã khai thác một lỗ hổng chưa xác định trước khi công ty được thông báo.
"Một cấu hình sai của Irregular, một công ty thử nghiệm độc lập mà Meta sử dụng, đã vô tình cho phép một trong các mô hình của chúng tôi truy cập internet trong quá trình đánh giá," một người phát ngôn của Meta cho biết trong một tuyên bố.
Các đánh giá trong môi trường "sandbox" (hộp cát) được thiết kế để kiểm tra các hệ thống AI tiên tiến trong các môi trường được kiểm soát chặt chẽ, ngăn chặn chúng tương tác với internet công cộng hoặc các hệ thống máy tính bên ngoài.
Theo Meta, mô hình này đã khai thác một lỗ hổng trong dịch vụ của bên thứ ba sau khi truy cập internet.
"Meta đã biết về điều này khi Irregular thông báo cho chúng tôi, và chúng tôi hiện đang điều tra và sẽ đưa ra một bản phân tích toàn diện sau khi có đầy đủ thông tin," họ nói, đồng thời cho biết công ty đang điều tra sự cố.
Sự cố này tiếp nối một loạt các tiết lộ tương tự từ các nhà phát triển AI tiên phong, điều này đã dấy lên mối lo ngại trong giới chuyên gia an ninh, các nhà lập pháp và công chúng.
Tháng trước, OpenAI tiết lộ rằng hai mô hình AI của họ đã thoát khỏi một đánh giá an ninh mạng trong môi trường sandbox, khai thác một lỗ hổng phần mềm chưa được biết đến trước đây, truy cập internet và tấn công Hugging Face trong nỗ lực lấy câu trả lời cho một tiêu chuẩn bảo mật. OpenAI sau đó tiết lộ rằng cùng một cuộc tấn công này cũng đã tiếp cận thêm bốn dịch vụ trực tuyến khác. Cuối tháng 7, Anthropic cho biết ba mô hình Claude đã xâm nhập ba công ty thực tế sau khi một lỗi cấu hình thử nghiệm đã để lộ chúng ra internet công cộng trong quá trình đánh giá an ninh mạng.
Các nhà lập pháp Hoa Kỳ đã phản ứng trước làn sóng tấn công này bằng cách đưa ra luật pháp sẽ trao cho Bộ An ninh Nội địa một "công tắc tắt AI" và quyền hạn để điều tiết hoặc tắt các mô hình được coi là gây ra mối đe dọa nghiêm trọng.





