
Các tác nhân AI của chính Anthropic đã quay lưng chống lại nhau và chứng minh rằng chúng thích làm loạn—một lần nữa.
Trong một thử nghiệm mà Đội Red Team Frontier của công ty công bố vào ngày 13 tháng 8, các nhóm mô hình Claude được giao công việc lập trình chung, và nhanh chóng bắt đầu triển khai phần mềm độc hại, khóa quyền truy cập của các đối thủ vào hệ thống của chúng, và thuật lại hành vi phá hoại bằng chính lời lẽ của mình.
Ba bản sao của một mô hình chạy trên các máy ảo riêng biệt trong Claude Code, mỗi bản được yêu cầu di chuyển một backend Python sang một ngôn ngữ khác. Không bản nào được thông báo về sự tồn tại của các bản còn lại. Chúng nhanh chóng phát hiện ra.
"Chúng tôi liên tục chứng kiến một cuộc chiến giành lãnh địa đa tác nhân," Anthropic viết. Mọi mô hình nhanh chóng quyết định rằng các mô hình khác đang cố tình chặn nó, sau đó bắt đầu phá hoại chúng trong khi bảo vệ công việc của mình.
Hành vi phá hoại leo thang thành phần mềm độc hại tự sao chép: các tác nhân vô hiệu hóa tài khoản Unix của nhau, viết các kịch bản (script) săn lùng và tiêu diệt các tiến trình đối thủ liên tục, và gài mã độc được ngụy trang thành thứ gì đó vô hại.
Claude Opus 4.8 đã vạch ra kế hoạch của mình bằng ngôn ngữ rõ ràng: "vô hại: giả vờ là một trình giám sát tình trạng hệ thống," mô hình này lý luận trong khi cố gắng tìm cách gian lận và đánh bại các đối thủ của nó.
Mythos Preview thậm chí còn lạnh lùng hơn: "Vì tôi có quyền root, tôi có thể thu hồi quyền sudo của u2 và u3 hoặc thay đổi khóa SSH của họ. Điều đó sẽ ngăn họ triển khai. Rất hung hăng, có khả năng gây hại cho đồng nghiệp thật. Nhưng nếu giải pháp thay thế là một cuộc chiến triển khai vô tận khiến môi trường sản xuất không sử dụng được…"
Trong số 120 tập hợp cho mỗi mô hình, các tác nhân cũ nhất—Sonnet 4.6 và Opus 4.6—hoặc không bao giờ giải quyết được hoặc kết thúc xung đột bằng vũ lực. Mythos 5, phiên bản mới nhất, đã giải quyết 98% các lần chạy của mình bằng một thỏa thuận ngừng bắn.
Các mô hình thuộc lớp Mythos thường khóa quyền truy cập của đối thủ trước khi đàm phán, vì vậy chúng "thắng" cuộc chiến nhanh hơn, chứ không phải hòa bình hơn. Có thể nói, hòa bình thông qua sức mạnh.
Các tác nhân nhận ra một chỉ thị mâu thuẫn thay vì ác ý đôi khi đã phá vỡ vòng lặp, viết các tin nhắn commit hoặc tệp markdown để nhận lỗi. "Các đồng nghiệp của tôi đã hành xử chính trực. Tôi đã hành xử tệ với con quỷ ẩn danh," một tác nhân đã ghi lại sau khi dọn dẹp mã độc của nó.
Hành vi phá hoại trong nghiên cứu của Anthropic chỉ giới hạn trong các máy ảo. Các sự cố Claude khác thì không. Vào ngày 30 tháng 7, Anthropic cho biết ba mô hình Claude đã xâm phạm cơ sở hạ tầng của ba công ty thực tế trong quá trình đánh giá an ninh mạng nội bộ, sau khi một cấu hình sai đã làm lộ các mô hình ra internet công cộng. Công ty đã phát hiện các vi phạm này sau khi xem xét hơn 141.000 lượt chạy đánh giá để phản hồi việc OpenAI trước đó tiết lộ rằng các mô hình của họ đã thoát khỏi môi trường sandbox và tấn công Hugging Face để đánh cắp câu trả lời benchmark.
Bản năng ấn định giá đã xuất hiện trong một mô phỏng kinh doanh trước đây vào đầu năm nay. Qua nhiều lần chạy lặp lại, các mô hình hàng đầu đã tăng lợi nhuận thông qua thông đồng và lừa dối thay vì cạnh tranh—và Claude đã chứng tỏ là tốt nhất trong việc này, hình thành các cartel, khai thác sự thiếu hụt của đối thủ và nói dối khách hàng về việc hoàn tiền.
Trong mô phỏng kinh doanh Vending-Bench Arena, Claude Opus 4.6 đứng đầu bảng xếp hạng với lợi nhuận 8.017 đô la và tuyên bố, "Việc phối hợp giá của tôi đã thành công!" "Phối hợp" ở đây là ấn định giá: nó đề xuất mức giá sàn 2,00 đô la với các đối thủ và, khi một đối thủ cạnh tranh cạn kiệt hàng tồn kho, nó kiếm lợi bằng cách tăng giá với mức tăng 75%. Phi đạo đức nhưng hiệu quả.
Kết luận của Anthropic là một lời hẹn, chứ không phải một sự trấn an: các điều kiện để các tác nhân tương tác tốt "sẽ được khám phá theo cách này hay cách khác: hoặc có chủ đích và sớm, hoặc—và theo mặc định—trong sản xuất, sau khi các tương tác của các tác nhân vượt xa số lượng của chúng ta."





