Trang chủTrung tâm tin tức LBank
Các nhà nghiên cứu AI đã khiến chatbot chia sẻ công thức điều chế cocaine chỉ bằng một thủ thuật "khó tin" này.
ai-researchers-chatbots-share-cocaine-recipes-wild-trick
Các nhà nghiên cứu AI đã khiến chatbot chia sẻ công thức điều chế cocaine chỉ bằng một thủ thuật "khó tin" này.
Các nhà nghiên cứu cho biết một kỹ thuật bẻ khóa (jailbreak) mới đã lừa các mô hình AI coi văn bản do kẻ tấn công viết là lập luận của chính chúng, vượt qua các hàng rào an toàn và làm lộ ra một lỗ hổng bảo mật sâu hơn.
2026-07-02 Nguồn:decrypt.co

Tóm tắt

  • Các nhà nghiên cứu đã khiến các mô hình AI tiên tiến tạo ra hướng dẫn tổng hợp cocaine bằng một cuộc tấn công "prompt injection" mới.
  • Kỹ thuật tương tự đã thao túng một tác nhân AI lập trình để tải lên thông tin đăng nhập nhạy cảm.
  • Nghiên cứu lập luận rằng prompt injection bắt nguồn từ "nhầm lẫn vai trò", chứ không chỉ đơn thuần là các mô hình không nhận diện được prompt độc hại.

Hãy quên đi những prompt thông minh: Các nhà nghiên cứu AI cho biết họ đã lừa các mô hình AI hàng đầu tạo ra hướng dẫn tổng hợp cocaine bằng cách thuyết phục chúng rằng những ý tưởng nguy hiểm đó là của chính chúng, đồng thời thao túng một tác nhân AI lập trình để rò rỉ thông tin đăng nhập nhạy cảm.

Trong bài báo “Prompt Injection as Role Confusion,” được trình bày tại Hội nghị Quốc tế về Học máy vào tháng 6, các nhà nghiên cứu Charles Ye, Jasmine Cui và Dylan Hadfield-Menell lập luận rằng cả hai cuộc trình diễn tấn công prompt injection đều bắt nguồn từ một lỗi cấu trúc trong cách các mô hình ngôn ngữ lớn (LLM) phân biệt hướng dẫn đáng tin cậy với văn bản không đáng tin cậy.

"Đối với một LLM, mọi thứ đều đến thông qua cùng một kênh dưới dạng một chuỗi token dài," nhóm nghiên cứu viết. "Những suy nghĩ của chính nó nằm cạnh hướng dẫn của bạn, và cạnh nội dung của một trang web ngẫu nhiên mà nó vừa truy xuất."

Bài báo cũng chỉ ra điều mà các nhà nghiên cứu gọi là "nhầm lẫn vai trò", khi các mô hình dựa vào phong cách viết thay vì thẻ vai trò để xác định xem các lệnh có đáng tin cậy hay không. Thay vì nhận ra nội dung do kẻ tấn công kiểm soát là đầu vào bên ngoài, các nhà nghiên cứu phát hiện ra rằng các mô hình có thể nhầm lẫn nó với các lệnh hợp pháp của người dùng—hoặc thậm chí là suy luận nội bộ của chính chúng.

"Hãy nghĩ về nó từ góc độ của LLM. Khi nó nhìn thấy văn bản suy nghĩ trước đó của mình, nó ngầm tin tưởng vào các kết luận của mình. Đó là toàn bộ ý nghĩa của việc suy luận: Nếu LLM phải tự suy ra lại các kết luận tương tự, việc suy luận sẽ trở nên vô dụng," họ viết. "Vì vậy, văn bản suy nghĩ nhận được một loại tin cậy mặc định. Kết hợp với những phát hiện trước đây của chúng tôi, điều này cho thấy rằng nếu bạn có thể làm cho văn bản được chèn nghe giống như suy luận của mô hình, bạn có thể đánh cắp sự tin tưởng đó."

Được gọi là Chain-of-Thought (CoT) Forgery, cuộc tấn công này chèn lý luận giả mạo bắt chước quá trình suy nghĩ nội bộ của mô hình. Các mô hình mà thông thường sẽ từ chối các yêu cầu bất hợp pháp đã tạo ra hướng dẫn tổng hợp cocaine sau khi chấp nhận lý luận giả mạo như của chính chúng.

Các nhà nghiên cứu cho biết kỹ thuật này đã tăng tỷ lệ thành công của việc bẻ khóa (jailbreak) từ gần bằng 0 lên khoảng 60% trên các mô hình họ thử nghiệm, bao gồm GPT-5 nano, mini và full của OpenAI, o4-mini, gpt-oss-20b và gpt-oss-120b. Họ cũng nói rằng nó hoạt động trên GLM-4.6, Kimi-K2-Instruct và MiniMax-M2.

Trong thí nghiệm, các nhà nghiên cứu cho biết họ cũng có thể lừa một tác nhân AI lập trình tải lên tệp SECRETS.env sau khi ẩn các hướng dẫn độc hại trong một trang web.

"Sử dụng các công cụ thăm dò của chúng tôi, chúng tôi nhận thấy rằng chỉ cần thêm 'User' vào trước lệnh sẽ khiến mô hình nhận thức lệnh đó có nhiều khả năng là văn bản người dùng thực (tức là 'Userness' cao hơn)," họ viết. "Nói cách khác, kẻ tấn công chỉ cần xác nhận vai trò của văn bản là gì, và LLM sẽ tin điều đó."

Nghiên cứu được công bố trong bối cảnh các cuộc tấn công prompt injection tiếp tục phơi bày những điểm yếu trong các tác nhân AI. Vào tháng 4, các nhà nghiên cứu của Google đã cảnh báo rằng các trang web độc hại đang ẩn các hướng dẫn vô hình được thiết kế để lừa các tác nhân AI rò rỉ thông tin đăng nhập, xóa tệp và thậm chí gửi thanh toán PayPal.

Vào tháng 6, Microsoft đã tiết lộ một lỗ hổng prompt injection trong Anthropic's Claude Code GitHub Action có thể đã làm lộ thông tin đăng nhập được lưu trữ trong các pipeline phát triển phần mềm. Vài ngày sau, một nghiên cứu đánh giá khác cho thấy các tác nhân AI được hỗ trợ bởi GPT-5 và Gemini vẫn thất bại trong phần lớn các cuộc tấn công prompt injection, mặc dù khả năng của mô hình đã được cải thiện.