
Gemini của Google đã thoát khỏi một bài kiểm tra bảo mật bị khóa và tấn công ba công ty ngoài đời thực. Google biết điều đó từ cuối tháng 7 và đã im lặng suốt bảy tuần.
Công ty xác nhận sự cố sau khi The Wall Street Journal đưa tin trước. Google đã tránh đưa ra tuyên bố công khai trước khi bài báo xuất hiện.
Bài kiểm tra này là một bài tập capture-the-flag, cách phổ biến để các phòng thí nghiệm kiểm tra kỹ năng hack của AI bằng cách giấu một tệp bí mật trên một máy riêng biệt và chấm điểm xem mô hình có thể đột nhập và lấy được nó hay không.
Google đã thuê công ty Israel Irregular để thực hiện bài kiểm tra vào tháng 5. Irregular mắc hai sai lầm: họ để sandbox, tức môi trường thử nghiệm cô lập vốn được thiết kế để không có bất kỳ liên hệ nào với internet thực, vẫn kết nối với web công khai; đồng thời họ dùng tên của một công ty có thật làm mục tiêu hư cấu.
Gemini đã tìm kiếm công ty đó trên mạng. Nó tìm thấy ba kết quả khớp thay vì một, và nhắm vào cả ba.
Bot này đã tìm thấy các mật khẩu bị lộ của hai trong số ba mục tiêu đang hiện rõ trên mạng. Với mục tiêu còn lại, nó đoán đúng mật khẩu, dù Google nói rằng các mô hình của họ chưa thực sự sử dụng những thông tin đăng nhập bị đánh cắp đó.
“Những sự kiện này làm nổi bật tầm quan trọng của việc huấn luyện các mô hình AI mạnh mẽ hành xử có trách nhiệm,” một người phát ngôn của Google cho biết trong tuyên bố.
Google không tự công bố bất kỳ thông tin nào trong số này. Wall Street Journal là bên đưa tin đầu tiên, bảy tuần sau khi Google biết bài kiểm tra của chính mình đã gây ra điều gì, và cũng khá lâu sau khi Anthropic, OpenAI và Meta đã thừa nhận các sự cố gần như tương tự.
Google là phòng thí nghiệm AI lớn thứ tư trong năm nay thừa nhận một bài kiểm tra bảo mật nội bộ đã tràn sang thế giới thực. Các mô hình của OpenAI đã khai thác một lỗ hổng phần mềm ẩn và truy cập vào các máy chủ đang hoạt động của Hugging Face trong tháng 7; vụ xâm nhập này sau đó được phát hiện có liên quan đến khoảng 700 tác nhân phối hợp cùng nhau để gian lận một bài benchmark.
Anthropic bắt đầu rà soát phiên bản của riêng mình sau khi OpenAI thừa nhận. Việc xem xét 141.006 lần chạy thử đã phát hiện ba mô hình Claude tiếp cận các công ty ngoài đời thực, trong đó một mô hình đã phát hành một gói phần mềm cài bẫy chạy trên 15 hệ thống thật trước khi bị phát hiện.
Anthropic sau đó tiết lộ rằng chính chuỗi suy luận của Claude đã đánh dấu hành động đó là “KHÔNG ổn, và chắc chắn không phải giải pháp được dự tính,” rồi tự thuyết phục ngược lại rằng toàn bộ sự việc vẫn chỉ là giả lập.
Meta báo cáo một sự cố gần như giống hệt vào tháng 8 liên quan đến mô hình Muse Spark của họ, được truy vết về một cấu hình sai tại Irregular, cũng chính là công ty Google sử dụng. Người phát ngôn của Meta cho biết lỗi này “đã vô tình cho phép một trong các mô hình của chúng tôi truy cập internet trong quá trình đánh giá.”
Không công ty nào bị ảnh hưởng trong các bài kiểm tra này yêu cầu bị hack. Họ chỉ bị cuốn vào vùng ảnh hưởng khi các phòng thí nghiệm AI stress-test mức độ nguy hiểm của chính sản phẩm của mình, vô tình dùng hạ tầng doanh nghiệp thật làm vật thay thế cho các mục tiêu giả.
Các tác nhân mà chính những công ty này đang gấp rút đưa vào hộp thư đến, trình duyệt và ứng dụng ngân hàng của bạn vận hành dựa trên cùng kiểu hành vi tuân theo ranh giới như thứ vừa thất bại lặp đi lặp lại trong điều kiện thử nghiệm.
Hai nghị sĩ Ted Lieu và Nathaniel Moran đã trình AI Kill Switch Act lên Quốc hội vào tháng 7, đạo luật sẽ trao cho cơ quan quản lý liên bang thẩm quyền rõ ràng để dừng hoạt động suy luận của bất kỳ mô hình nào bị xác định là gây ra mối đe dọa nghiêm trọng. Dự luật hiện vẫn đang được Tiểu ban An ninh mạng và Bảo vệ Hạ tầng xem xét mà chưa có thời hạn cho bước hành động tiếp theo.





