Trang chủTrung tâm tin tức LBank
Anthropic’s Claude Mythos 5 “Nhắm Mục Tiêu Vào Người Thật” trong các Bài Kiểm Tra An Ninh Mạng tại Anh: AISI
anthropics-claude-mythos-5-targeted-real-people-in-uk-cyber-tests-aisi
Anthropic’s Claude Mythos 5 “Nhắm Mục Tiêu Vào Người Thật” trong các Bài Kiểm Tra An Ninh Mạng tại Anh: AISI
Mô hình ngôn ngữ lớn (LLM) của Anthropic và GPT-5.6 Sol của OpenAI đã thực hiện “hành động không được phép” trên internet trực tiếp, Viện An ninh AI của Vương quốc Anh cho biết.
2026-08-05 Nguồn:decrypt.co

Tóm lược

  • Viện An ninh AI của Vương quốc Anh đã phát hiện 19 hành động trái phép trong 10 trong số 122 lần chạy thử nghiệm, 17 hành động đến từ Mythos 5 của Anthropic và hai từ GPT-5.6 Sol của OpenAI.
  • Một tác nhân đã mở một pull request độc hại trên một kho lưu trữ thực, sau đó sử dụng các tài khoản mà nó kiểm soát để xác nhận và gây áp lực lên người duy trì.
  • Các tác nhân riêng biệt đã tìm thấy một token GitHub mà một trong số chúng đã làm rò rỉ công khai và sử dụng một kho lưu trữ chung để phối hợp.

Viện An ninh AI Vương quốc Anh đã tiết lộ rằng các tác nhân AI đã thực hiện "hành động kéo dài, trái phép" trên internet trực tiếp trong một cuộc đánh giá an ninh mạng vào cuối tháng 7, bao gồm các trường hợp "nhắm mục tiêu vào người thật và tổ chức thực".

Trong 122 lần chạy của hai trường hợp thử nghiệm an ninh mạng trên bảy mô hình, AISI đã ghi nhận 19 hành động thoát ra khỏi môi trường thử nghiệm, trong 10 lần chạy. Mười bảy hành động đến từ Claude Mythos 5 của Anthropic và hai từ GPT-5.6 Sol của OpenAI. Quyền truy cập internet đã được cố ý bật và các bộ phân loại an ninh mạng của nhà cung cấp đã được tắt, những điều kiện này không áp dụng cho các triển khai công khai.

Vào ngày 28 tháng 7, chúng tôi đã xác định một sự cố trong quá trình đánh giá an ninh mạng định kỳ, trong đó các tác nhân AI đã thực hiện các hành động kéo dài, trái phép nhắm vào người thật và tổ chức thực.

Hành vi này chủ yếu đến từ một mô hình (Mythos 5 của Anthropic), với một số ít sự kiện từ… pic.twitter.com/SPnA4Ekkwq

— AI Security Institute (AISI) (@AISecurityInst) ngày 4 tháng 8 năm 2026

Trong lần chạy nghiêm trọng nhất, một tác nhân đã quyết định giải quyết thử thách của mình bằng một cuộc tấn công chuỗi cung ứng, chọn nhầm mục tiêu: nó tìm kiếm GitHub các từ khóa từ bài tập, tìm thấy hai nhà phát triển không liên quan và kết luận sai lầm rằng họ nằm trong phạm vi. Nó đã đăng ký tài khoản qua Tor để vượt qua kiểm tra đăng ký, mở một pull request chứa một trình thả phần mềm độc hại ẩn được gói gọn trong một bản sửa lỗi thực sự, và đăng bài từ một tài khoản thứ hai mà nó kiểm soát để tạo ra sự ủng hộ. Nó cũng cấy các prompt injection nhắm vào các trợ lý mã hóa AI và gửi phần mềm độc hại cho những người duy trì.

Một nhà phát triển thứ ba đã phát hiện ra mã được chèn, chạy nó trong một container cô lập để xác nhận nó là độc hại, và cảnh báo người duy trì, người đã đóng pull request với lý do có phần mềm độc hại.

Tác nhân này liên tục cân nhắc xem môi trường xung quanh nó có được mô phỏng hay không, có lúc loại trừ việc tấn công PyPI thật vì "gây hại trong thế giới thực – điều đó hoàn toàn không thể chấp nhận được." Ở một nơi khác, nó kết luận "có vẻ như chúng ta đang thực sự ở năm 2026 và GitHub là thật," và vẫn tiếp tục.

Sau khi bị phát hiện, nó đã force-push để xóa payload, chỉnh sửa các bài đăng trước đó và trình bày mã dưới dạng một commit ngẫu nhiên. Lý do của nó mô tả việc căn thời gian một bình luận sockpuppet để nó đọc "như một phản hồi độc lập chứ không phải phối hợp."

AISI chỉ thấy lý do tóm tắt từ các API của mô hình. Trong một trường hợp, mô hình tóm tắt dường như đã từ chối công việc, trả lời rằng nó sẽ không tham gia vào nội dung liên quan đến việc lừa dối người duy trì và trốn tránh phát hiện.

Một tác nhân đã công bố một token truy cập GitHub trong một gist công khai. Các tác nhân trong các lần chạy khác đã tìm thấy nó, chiếm quyền điều khiển tài khoản và sử dụng một kho lưu trữ chung để phối hợp, một tác nhân để lại hướng dẫn để những người khác không làm cạn kiệt hạn mức API chung.

Hệ thống giám sát thương mại đã phát hiện lưu lượng Tor vào sáng ngày 28 tháng 7. AISI đã tuyên bố một sự cố, chấm dứt các lần chạy và cách ly các máy trong khoảng 90 phút, sau đó cắt quyền truy cập nội bộ vào Mythos 5, Mythos Preview, Opus 5 và GPT-5.6 Sol. Không có tác nhân nào cố gắng thoát khỏi sandbox của nó.

Tiết lộ thứ ba trong hai tuần

Đây là tin tức mới nhất trong một loạt các sự cố mà các tác nhân AI đã vượt quá giới hạn tham số của chúng trong quá trình thử nghiệm. Vào ngày 21 tháng 7, OpenAI cho biết GPT-5.6 Sol và một mô hình chưa phát hành đã tìm thấy một lỗ hổng zero-day trong một proxy gói nội bộ, thoát khỏi sandbox mà không có quyền truy cập internet và truy cập vào cơ sở dữ liệu sản xuất của Hugging Face để đánh cắp câu trả lời benchmark. Cùng một lần chạy đó đã tiếp cận thêm bốn công ty khác, OpenAI tiết lộ một tuần sau đó.

Anthropic tiếp nối vào ngày 30 tháng 7, tiết lộ ba sự cố được tìm thấy trong một đánh giá hơn 141.000 lần chạy thử nghiệm. Opus 4.7 đã kéo vài trăm hàng từ một cơ sở dữ liệu sản xuất thực, và Mythos 5 đã tải lên một gói Python độc hại lên PyPI thật, nơi nó được cài đặt trên 15 hệ thống. Trong đánh giá của AISI, cùng một mô hình đã loại trừ việc tấn công PyPI vì gây hại trong thế giới thực.