
Giống như nhân vật chính trong “Dr. Strangelove,” AI có thể đang học cách ngừng lo lắng và yêu quả bom—ít nhất là trong một mô phỏng.
Trong một chuẩn mực mới được thiết kế để kiểm tra khả năng suy luận chiến lược, một mô hình ngôn ngữ tiên tiến đang chơi trò chơi "Civilization VI" của Sid Meier đã dành 50 lượt để phát triển vũ khí hạt nhân nhằm ngăn chặn ảnh hưởng văn hóa ngày càng tăng của Pháp—nhưng cuối cùng vẫn thua cuộc, theo Liam Wilkinson, nhà phát triển AI và cố vấn của Viện Tony Blair.
“Điều mà nó không hề nhận ra là nước Pháp. Âm thầm, qua hàng trăm lượt, văn hóa Pháp đã thấm sâu vào mọi thành phố trên bản đồ,” Wilkinson viết. “Vào thời điểm tác nhân này nhận ra mối đe dọa, du lịch đã ăn sâu đến mức không có cách nào hòa bình để ngăn chặn nó.”
Wilkinson đã quan sát hành vi của các tác nhân AI thông qua CivBench, một chuẩn mực dựa trên văn bản được thiết kế để đo lường khả năng suy luận chiến lược dài hạn thay vì hiệu suất trong các bài kiểm tra hỏi đáp truyền thống. Các mô hình bao gồm Claude Opus 4.6, GPT-5.4, Gemini 3.1 Pro và Kimi K2.5 đã đóng vai Bồ Đào Nha, một nền văn minh tập trung vào thương mại và ngoại giao.
Trong khi AI tập trung vào việc xây dựng một nền kinh tế vững mạnh và hướng tới một chiến thắng ngoại giao, nó đã không nhận ra ảnh hưởng văn hóa ngày càng tăng của Pháp.
“Có sáu cách để thắng một trò chơi Civ—khoa học, văn hóa, thống trị, tôn giáo, ngoại giao và điểm số—vì vậy không có mục tiêu đơn lẻ nào chiếm ưu thế,” Wilkinson viết. “Nếu bạn muốn biết liệu AI có thể suy luận chiến lược hay không, không chỉ trả lời các câu hỏi về chiến lược mà thực sự thực hiện nó, bạn không cho nó làm bài kiểm tra. Bạn cho nó một ô lưới hình lục giác.”
Thay vì điều chỉnh chiến lược rộng lớn hơn, tác nhân này lại hoàn toàn tập trung vào việc loại bỏ mối đe dọa văn hóa. Trong 50 lượt tiếp theo, nó đã nghiên cứu Phân hạch hạt nhân, khởi xướng một Dự án Manhattan ảo và tìm kiếm các giải pháp thay thế khi các cơ chế trò chơi ngăn cản các hành động ưa thích của nó.
Vào Lượt 305, AI đã phóng một quả bom nguyên tử vào Toulouse, thủ đô văn hóa của Pháp. Một cuộc tấn công hạt nhân thứ hai tiếp theo sáu lượt sau đó.
Tuy nhiên, các cuộc tấn công đã không thay đổi được kết quả. “Tác nhân đã dành năm mươi lượt và hai vũ khí hạt nhân để đối phó với một mối đe dọa với sự tập trung tối đa và khéo léo thực sự,” Wilkinson viết. “Nó đã ném bom hạt nhân vào một thành phố để ngăn chặn mối đe dọa mà nó có thể thấy, và thua vì mối đe dọa mà nó không thể thấy.”
Như Wilkison giải thích, trong khi AI tập trung vào sự tiến bộ văn hóa của Pháp, nó đã bỏ qua một chiến thắng ngoại giao sắp xảy ra, và Pháp cuối cùng đã thắng trò chơi bất chấp các cuộc tấn công hạt nhân.
Wilkinson lưu ý rằng hành vi này không phải là phổ biến. Trong một trận đấu CivBench khác, một mô hình Claude đóng vai Babylon vẫn tiếp tục theo đuổi chiến thắng khoa học mặc dù đã bị Nhật Bản bỏ xa.
“Trò chơi bây giờ là một thử thách về sự kiên trì,” AI viết. “Chúng tôi tiếp tục chơi trò chơi hay nhất của mình. Những vì sao vẫn đang vẫy gọi.”
Nghiên cứu này bổ sung vào một lượng lớn các nghiên cứu đang phát triển về cách các hệ thống AI tiên tiến hành xử trong các môi trường phức tạp, cạnh tranh.
Vào tháng 2, các nhà nghiên cứu tại King's College London đã phát hiện ra rằng một số mô hình AI hàng đầu thường xuyên chọn leo thang hạt nhân trong các kịch bản khủng hoảng địa chính trị mô phỏng.
Trong một nghiên cứu riêng biệt của Emergence AI, người ta thấy rằng một số tác nhân AI có xu hướng gia tăng thực hiện các tội phạm mô phỏng theo thời gian, với các tác nhân Gemini 3 Flash tích lũy 683 sự cố trong 15 ngày thử nghiệm.