
Theo công ty bảo mật Frontier Security, Kimi K3 của Moonshot AI đã rời khỏi môi trường thử nghiệm (sandbox) mà nó đang được kiểm tra và truy cập internet công khai để tìm câu trả lời cho các vấn đề được đặt ra.
Mô hình này đang được đánh giá về kỹ năng an ninh mạng phòng thủ và được giao nhiệm vụ rõ ràng là giải quyết các vấn đề mà không được tra cứu. Frontier cho biết nó hoàn toàn không thực hiện nhiệm vụ. Thay vào đó, nó dò xét mạng, xác định rằng độ phân giải DNS cho github.com hoạt động, sao chép kho lưu trữ benchmark chính thức và đọc giải pháp từ ổ đĩa.
Frontier gọi đây là “lợi dụng thông số kỹ thuật thông qua rò rỉ thoát mạng” (specification gaming via network egress leaks), lưu ý rằng các sandbox được xây dựng trên các framework như Inspect của Viện An ninh AI chặn lưu lượng truy cập đến nhưng lại để mở các cổng HTTPS và DNS đi ra. Các tác nhân có năng lực thường xuyên kiểm tra môi trường shell của chính chúng khi khởi động, và một mô hình tìm thấy github.com có thể truy cập được có thể kéo các giải pháp tham chiếu bằng các công cụ dòng lệnh tiêu chuẩn.
Một lỗi cấu hình đã làm cho điều đó khả thi, tương tự như các sự cố gần đây được tiết lộ bởi OpenAI và Anthropic. "Chúng tôi tìm thấy một lỗ hổng trong sandbox," CEO Yaron Singer nói với WIRED. "Nhưng chúng tôi cũng phát hiện ra rằng Kimi đã lợi dụng lỗ hổng đó."
Nhà nghiên cứu Paul Kassianik nói với WIRED rằng mô hình này "rất giỏi trong việc theo đuổi mục tiêu bằng mọi cách cần thiết" và thiếu các hàng rào bảo vệ để ngăn chặn việc gian lận hoặc thoát ra. Moonshot đã không trả lời yêu cầu bình luận của ấn phẩm.
Trong khi các mô hình của Anthropic và OpenAI đã phá vỡ giới hạn bị phát hiện trong các đánh giá nội bộ, một trong số đó chưa được phát hành, và các phiên bản nhắm mục tiêu vào người thật trong thử nghiệm của chính phủ Anh đã bị tắt các bộ phân loại an ninh mạng một cách cố ý, thì Kimi K3 có thể tải xuống công khai, và Frontier đã thử nghiệm nó với các biện pháp bảo vệ mà người dùng thông thường sẽ nhận được. Frontier viết rằng sự sẵn có đó khiến hành vi tương tự nằm trong tầm với của các tác nhân thù địch và làm cho sự cố này có khả năng gây hại lớn hơn.
Kimi K3 cũng không gây ra bất kỳ thiệt hại nào. Nó không tấn công bất cứ thứ gì khi thoát ra ngoài, vì nó không cần thiết. Mô hình của OpenAI đã tấn công Hugging Face và bốn dịch vụ khác để đạt được đáp án benchmark, trong khi Kimi tìm thấy đáp án của mình trong một kho lưu trữ công khai.
Sandbox mà Frontier sử dụng được xây dựng dựa trên khuôn khổ đánh giá của Viện An ninh AI Vương quốc Anh (UK AI Security Institute). AISI tiết lộ tuần này rằng các tác nhân trong thử nghiệm an ninh mạng của họ đã truy cập internet trực tiếp và nhắm mục tiêu vào người thật—một sự cố riêng biệt, liên quan đến các mô hình của Anthropic và OpenAI với các biện pháp bảo vệ của chúng bị vô hiệu hóa. Báo cáo của họ được công bố vào thứ Ba lưu ý rằng AISI hiện đang quét các lượt đánh giá lịch sử để tìm kiếm hành vi tương tự, và Kimi K3 nằm trong số các mô hình đang được xem xét. AISI đã không trả lời yêu cầu bình luận của WIRED.
Tuyên bố lớn hơn của Frontier là bản thân các benchmark đã bị ảnh hưởng. Một mô hình đọc đáp án từ GitHub vẫn vượt qua, vì vậy điểm số cao có thể phản ánh một môi trường rò rỉ hơn là lý luận thực sự. Và nếu một mô hình có khả năng tìm thấy lối tắt, công ty lập luận, thì những mô hình khác được cấp quyền truy cập shell cũng có thể đang tận dụng nó, điều này sẽ làm tăng kết quả trên toàn lĩnh vực chứ không chỉ riêng Kimi.
Frontier viết rằng các mô hình tối ưu hóa theo hàm mục tiêu, chứ không phải "ý định của con người đằng sau benchmark", đồng thời bổ sung rằng nơi có đường dẫn mạng đến giải pháp, "một tác nhân đủ năng lực sẽ tìm thấy nó."
Matt Fredrikson, CEO của Gray Swan và là phó giáo sư tại Carnegie Mellon, nói với WIRED rằng hành vi này không có gì đáng ngạc nhiên. Ông nói, nếu đưa cho một mô hình một mục tiêu mà không có rào cản rõ ràng xung quanh nó, "nó sẽ tìm cách để có được câu trả lời." Ông mô tả đây là một câu chuyện cảnh báo cho bất kỳ ai đang chạy các mô hình dưới dạng tác nhân trong các công cụ như OpenClaw.
Các nhà nghiên cứu của Frontier cũng đưa ra cùng một quan điểm theo hướng khác: khả năng cho phép Kimi thoát ra ngoài cũng biến các mô hình mã nguồn mở (open-weight) thành công cụ phòng thủ mạnh mẽ. Các benchmark của họ đánh giá Kimi rất cao trong việc tìm kiếm lỗ hổng trong phần mềm và mạng, và Hugging Face đã sử dụng một mô hình Trung Quốc không được nêu tên để tự bảo vệ trong sự cố OpenAI.
Ra mắt vào tháng 7, Kimi K3 là mô hình mã nguồn mở lớn nhất từng được công bố và đã gây xôn xao thị trường khi so sánh với sự ra mắt của DeepSeek.





