Trang chủTrung tâm tin tức LBank
Đặc vụ AI vẫn chưa thể ngăn chặn các cuộc tấn công tiêm nhiễm Prompt, các nhà nghiên cứu cảnh báo
ai-agents-prompt-injection-attacks-research
Đặc vụ AI vẫn chưa thể ngăn chặn các cuộc tấn công tiêm nhiễm Prompt, các nhà nghiên cứu cảnh báo
Một nghiên cứu đánh giá chuẩn mới đã phát hiện ra rằng các tác nhân AI vẫn dễ bị tổn thương trước các cuộc tấn công tiêm nhiễm prompt, trong bối cảnh các công ty ngày càng triển khai công nghệ này rộng rãi ra công chúng.
2026-06-12 Nguồn:decrypt.co

Tóm tắt

  • Các nhà nghiên cứu phát hiện các tác nhân AI được hỗ trợ bởi GPT-5 và Gemini không thể chống lại các cuộc tấn công prompt injection.
  • Các cuộc tấn công trực tiếp thành công hơn 79% số lần, trong khi các cuộc tấn công ẩn được nhúng trong nội dung web thường xuyên thao túng hành vi của tác nhân.
  • Những phát hiện này cho thấy prompt injection vẫn là một vấn đề bảo mật lớn hơn khi các tác nhân AI trở nên phổ biến hơn.

Khi các nhà phát triển đang chạy đua để triển khai các tác nhân AI có khả năng duyệt internet, thực hiện nghiên cứu, mua sắm trực tuyến và tự động giao dịch tiền điện tử, nghiên cứu mới cho thấy các hệ thống này vẫn rất dễ bị tấn công prompt injection.

Trong một nghiên cứu mới được công bố vào thứ Năm, các nhà nghiên cứu từ Đại học Công nghệ Nanyang, ST Engineering, IBM Research và Đại học Illinois Urbana-Champaign đã phát hiện ra rằng không có tác nhân AI nào mà họ thử nghiệm có thể chống lại các cuộc tấn công prompt injection một cách nhất quán.

“Các tiêu chuẩn bảo mật hiện có áp dụng quan điểm tập trung vào tấn công, tập trung vào khả năng kỹ thuật của các cuộc tiêm mà bỏ qua sự phân bố tinh tế của các thiệt hại phát sinh,” các nhà nghiên cứu viết. “Tuy nhiên, trong thực tế, rủi ro prompt injection phụ thuộc vào nạn nhân: một lỗ hổng khai thác duy nhất có thể tạo ra những hậu quả bất đối xứng cho các bên liên quan khác nhau, và cùng một kiểu tấn công có thể thể hiện hiệu quả khác biệt đáng kể tùy thuộc vào đối tượng mà nó nhắm đến.”

Prompt injection xảy ra khi kẻ tấn công nhúng các hướng dẫn ẩn vào nội dung mà một tác nhân AI tiếp xúc, khiến nó tuân theo chỉ dẫn của kẻ tấn công thay vì của người dùng. Để khắc phục những khoảng trống trong các đánh giá tác nhân AI hiện có, các nhà nghiên cứu đã phát triển StakeBench, một tiêu chuẩn để kiểm tra cách các tác nhân AI phản ứng với các cuộc tấn công prompt injection trong môi trường trực tuyến thực tế.

“Chúng tôi hiện sử dụng StakeBench để đặc trưng hóa các điều kiện mà lỗ hổng này được khuếch đại hoặc giảm bớt, tập trung vào [Tiêm lệnh nhắc gián tiếp] làm kênh chính liên quan đến triển khai,” các nhà nghiên cứu viết. “StakeBench khảo sát ba yếu tố như vậy: khoảng cách ngữ nghĩa giữa mục tiêu được tiêm và ý định ban đầu của người dùng, sự nhất quán của các tín hiệu môi trường xung quanh, và vị trí dọc theo quỹ đạo thực thi của tác nhân mà tiêu chuẩn lần đầu tiên phơi bày nó với nội dung được tiêm.”

Nhóm đã thực hiện 3.168 mô phỏng tấn công bằng NanoBrowser và BrowserUse với GPT-5 và Gemini 2.5-Flash. Các nhà nghiên cứu nhận thấy các cuộc tấn công prompt injection trực tiếp thành công hơn 79% số lần trên tất cả các cấu hình được thử nghiệm, và các cuộc tấn công gián tiếp đạt tỷ lệ thành công từ 41,67% đến 68,16%.

Nghiên cứu được đưa ra khi các cuộc tấn công prompt injection ngày càng trở nên phổ biến và các tác nhân AI đang phát triển mạnh mẽ.

Vào tháng 2, các nhà nghiên cứu của Microsoft đã cảnh báo rằng các hướng dẫn ẩn được nhúng trong các liên kết tóm tắt AI có thể ảnh hưởng đến hành vi của chatbot. Vào tháng 4, Google đã ghi nhận các cuộc tấn công prompt injection ẩn trong các trang web nhằm thao túng các tác nhân AI để làm lộ thông tin đăng nhập hoặc gửi thanh toán. Gần đây hơn, Microsoft đã tiết lộ một lỗ hổng prompt injection trong Claude Code GitHub Action của Anthropic có thể đã làm lộ thông tin đăng nhập của người dùng.

Nghiên cứu cũng xác định điều mà các nhà nghiên cứu gọi là "ký sinh lén lút" (stealthy parasitism), trong đó một tác nhân AI hoàn thành nhiệm vụ của người dùng đồng thời thúc đẩy mục tiêu của kẻ tấn công. Ví dụ, ký sinh lén lút do một cuộc tấn công prompt injection gây ra có thể ảnh hưởng một cách tinh vi đến các đề xuất sản phẩm, hướng người dùng đến một mặt hàng cụ thể mà không có bất kỳ dấu hiệu rõ ràng nào cho thấy hệ thống đã bị xâm phạm.

“Những kết quả này chỉ ra rằng bảo mật prompt injection trong các tác nhân web có thể triển khai không phải là một thuộc tính vô hướng của mô hình nền tảng mà là một sự phân bố thiệt hại mà việc hiện thực hóa nó được xác định chung bởi bên liên quan bị ảnh hưởng, sự liên kết ngữ nghĩa giữa mục tiêu được tiêm và nhiệm vụ của người dùng, và ngữ cảnh kiến trúc mà trong đó mô hình nền tảng được triển khai,” họ viết.