
Anthropic đã cử khoảng sáu kỹ sư vào Cơ quan An ninh Quốc gia (NSA) để giúp triển khai Mythos—mô hình AI tiên tiến nhất của họ—cho các hoạt động tác chiến mạng tấn công, tờ Financial Times đưa tin hôm thứ Năm.
Các kỹ sư này là nhân viên được triển khai tiền tuyến, tùy chỉnh mô hình cho các ứng dụng cụ thể. Một nguồn tin nói với FT rằng nó có thể hữu ích để xâm nhập mạng lưới ở các quốc gia như Trung Quốc và Iran.
Việc các kỹ sư đó có tham gia vào các hoạt động thực tế hay không vẫn chưa được xác nhận. Điều đã được xác nhận: Mythos là mô hình mà Anthropic đã từ chối phát hành công khai, với lý do rủi ro lạm dụng. Công ty đã giới hạn nó cho các đối tác được kiểm duyệt thông qua Dự án Glasswing—một liên minh hạn chế bao gồm Microsoft, Apple và Amazon.
Anthropic cũng đang kiện Lầu Năm Góc. Cuối tháng 2, Bộ trưởng Quốc phòng Pete Hegseth đã gán cho công ty này nhãn "rủi ro chuỗi cung ứng"—một nhãn hiệu vốn dành cho các đối thủ nước ngoài như Huawei—sau khi một hợp đồng trị giá 200 triệu đô la bị đổ vỡ. Điểm mấu chốt: Anthropic từ chối cho Bộ Quốc phòng sử dụng Claude cho vũ khí tự động hoàn toàn hoặc giám sát hàng loạt trong nước. Hợp đồng với NSA được miễn trừ khỏi lệnh cấm đó.
Một thẩm phán California đã chặn việc đưa vào danh sách đen, coi đó là một sự trả đũa rõ ràng vi phạm Tu chính án thứ nhất. Tòa án phúc thẩm D.C. đã từ chối yêu cầu của Anthropic về việc tạm dừng trong khi vụ kiện đang diễn ra. NSA vẫn tiếp tục sử dụng Mythos trong suốt thời gian đó, theo báo cáo của FT.
Làm thế nào để ngăn chặn AI tự xây dựng AI
Cùng ngày câu chuyện về NSA được công bố, viện nghiên cứu nội bộ của Anthropic đã xuất bản "Khi AI tự xây dựng chính nó," một cái nhìn về mức độ mà Claude đã đạt được trong việc tự động hóa quá trình phát triển của chính nó. Trong đó, công ty lập luận về việc thực chất là một lệnh cấm toàn cầu trong cuộc chạy đua vũ khí AI—và thậm chí so sánh nó với các hiệp ước hạt nhân thời Chiến tranh Lạnh được ký kết giữa Hoa Kỳ và Nga.
Để hiểu tại sao, công ty đã cung cấp bối cảnh này:
Claude hiện viết hơn 80% mã được hợp nhất vào cơ sở mã sản xuất của Anthropic—tăng từ mức thấp một con số trước khi Claude Code ra mắt vào đầu năm 2025. Các kỹ sư xuất xưởng lượng mã gấp khoảng tám lần mỗi ngày so với năm 2024.
Các tác giả của báo cáo—Trưởng viện Anthropic Marina Favaro và đồng sáng lập Jack Clark—lập luận rằng quỹ đạo này đang hướng tới cái mà họ gọi là tự cải tiến đệ quy: các hệ thống AI tự động thiết kế, xây dựng và huấn luyện các phiên bản kế nhiệm của chính chúng, với vai trò của con người ngày càng giảm dần ở mọi bước.
Trong một hình ảnh minh họa, các nhà nghiên cứu đã chỉ ra một dòng thời gian mà cách đầu tiên để sử dụng AI trong công việc là con người ra lệnh cho máy tính để có được kết quả, với sự tự động hóa ngày càng tăng, kết thúc bằng các tác nhân AI (AI Agents) tự ra lệnh cho các tác nhân phụ cho đến khi đạt được kết quả, không cần sự can thiệp của con người.
Điểm dữ liệu sắc nét nhất mà họ trích dẫn: Vào tháng 4, các tác nhân Claude đã được giao một vấn đề an toàn AI mở—liệu một mô hình yếu hơn có thể giám sát một mô hình mạnh hơn một cách đáng tin cậy hay không—và để chúng tự chạy. Hai nhà nghiên cứu con người trong khoảng một tuần đã khắc phục được 23% khoảng cách hiệu suất giữa các mô hình. Các tác nhân đã khắc phục được 97%, trong hơn 800 giờ tính toán tích lũy. Con người đặt câu hỏi. Các tác nhân đã thiết kế mọi thí nghiệm. Đây là trường hợp được công bố đầu tiên về việc Claude thực hiện phán đoán nghiên cứu, không chỉ thực hiện các nhiệm vụ do người khác chỉ định.
Đó là ranh giới mà Anthropic đang lo ngại sẽ vượt qua. Một khi AI chọn những thí nghiệm nào đáng để chạy—không chỉ chạy chúng—con người sẽ mất đi vai trò có ý nghĩa cuối cùng trong vòng lặp phát triển. Những sai lệch nhỏ có thể thấy trong các mô hình hiện nay có thể tích tụ qua các thế hệ tự cải tiến cho đến khi không ai có thể sửa chữa chúng.
Giải pháp được đề xuất của họ là một lệnh tạm dừng toàn cầu có thể kiểm chứng—nhiều phòng thí nghiệm tiên phong đồng thời ngừng hoạt động, với xác minh độc lập rằng mọi người thực sự đã dừng lại. Anthropic cho biết họ sẽ tham gia một lệnh như vậy. Một sự chậm lại đơn phương, họ thừa nhận, chỉ trao lợi thế cho bất cứ ai tiếp tục.
Chúng ta đã thấy bộ phim này rồi. Các phòng thí nghiệm xây dựng AI cũng chính là những người cảnh báo AI nguy hiểm như thế nào. Tuy nhiên, AI là ngành kinh doanh sinh lời nhất thập kỷ, nên không ai muốn dừng lại—ngay cả những người cảnh báo về AI.
Trở lại năm 2023, hơn một trăm nhân vật nổi tiếng trong cộng đồng nghiên cứu AI đã ký một bức thư ngỏ kêu gọi nỗ lực toàn cầu để giảm thiểu rủi ro tuyệt chủng mà sự phát triển AI vốn có. Vài tháng trước đó, một bức thư ngỏ khác đã yêu cầu OpenAI tạm dừng các tiến bộ trên ChatGPT do bản chất nguy hiểm của nó.
Không ai dừng lại sau bức thư ngỏ năm 2023. OpenAI không dừng. Anthropic cũng không dừng. Hạn chót của Lầu Năm Góc để loại bỏ Claude khỏi các hệ thống của họ là vào tháng 8, cùng thời điểm dự kiến IPO của Anthropic sẽ đưa tình hình tài chính của công ty ra công chúng.