
Hiện tượng AI "ảo giác" có thể không chỉ là những câu trả lời không chính xác—chúng có thể trở thành một cách để tin tặc xâm nhập máy tính, theo nghiên cứu mới từ Đại học Tel Aviv, Technion và Intuit.
Trong bài báo “Beware of Agentic Botnets: Scalable Untargeted Promptware Attacks via Universal and Transferable Adversarial HalluSquatting” (Cảnh giác với Botnet tác nhân: Các cuộc tấn công Promptware không định hướng, có thể mở rộng thông qua HalluSquatting đối kháng phổ quát và có thể chuyển giao), các nhà nghiên cứu đã trình bày một kỹ thuật khai thác các mô hình AI khi chúng tạo ra các liên kết giả mạo đến các kho lưu trữ phần mềm và các tài nguyên trực tuyến khác.
“Việc áp dụng ngày càng tăng các ứng dụng LLM có khả năng tác nhân đã đưa ra một mối đe dọa mới trước đây được gọi là promptware,” các nhà nghiên cứu viết. “Trong khi công trình trước đây đã xác định rằng kẻ thù có thể khai thác các kênh trực tiếp đến các ứng dụng LLM để áp dụng promptware dưới các mô hình mối đe dọa yếu, nhiều ứng dụng không cung cấp bất kỳ kênh trực tiếp nào có thể bị khai thác để chèn lệnh (prompt injection) ngoài Internet.”
Được gọi là chiếm đoạt ảo giác đối kháng (adversarial hallucination squatting) hay “HalluSquatting,” cuộc tấn công này liên quan đến việc dự đoán các tài nguyên giả mạo mà các mô hình AI có khả năng tạo ra, đăng ký các tên đó và thêm các chỉ dẫn độc hại. Nếu một tác nhân AI sau đó truy xuất tài nguyên "ảo giác" đó, nó có thể coi nội dung do kẻ tấn công kiểm soát là hợp pháp.
Các nhà nghiên cứu cho biết mối đe dọa này xuất hiện khi các trợ lý AI vượt ra ngoài việc trả lời câu hỏi và có được khả năng tương tác với máy tính—truy cập tệp, tìm kiếm trên web, viết mã và chạy lệnh.
Những khả năng đó có thể tạo ra các lỗ hổng bảo mật khi các tác nhân hành động dựa trên thông tin mà chúng truy xuất mà không xác nhận xem nguồn đó có thật hay không.
“Các nghiên cứu đang diễn ra đã chứng minh nhiều biến thể của các cuộc tấn công Promptware chống lại các hệ thống thế giới thực, bao gồm ChatGPT, Google Assistant, Copilot và nhiều ứng dụng bổ sung,” họ viết. “Những công trình này đã chứng minh rằng Promptware có thể dẫn đến các tác động về tài chính, quyền riêng tư và an toàn.”
Các nhà nghiên cứu cảnh báo kỹ thuật này có thể cho phép kẻ tấn công xây dựng các mạng botnet được hỗ trợ bởi AI. Một botnet đề cập đến một mạng lưới các máy tính hoặc thiết bị bị nhiễm độc được điều khiển từ xa bởi một kẻ tấn công. Botnet thường được sử dụng trong các cuộc tấn công mạng, bao gồm tấn công từ chối dịch vụ, đào tiền điện tử, phân phối phần mềm độc hại và các chiến dịch mã độc tống tiền.
Trong thử nghiệm, các nhà nghiên cứu phát hiện ra rằng hiện tượng "ảo giác" tài nguyên do AI tạo ra xảy ra với tỷ lệ cao tới 85% trong các kịch bản nhân bản kho lưu trữ và 100% trong các bài kiểm tra cài đặt kỹ năng.
Nhóm đã đánh giá kỹ thuật này chống lại các trợ lý và tác nhân lập trình AI, bao gồm Cursor, GitHub Copilot, Gemini CLI và OpenClaw.
HalluSquatting tương tự như typosquatting, một chiến thuật tấn công mạng trong đó kẻ tấn công đăng ký các tên miền giống với các trang web hoặc gói phần mềm hợp pháp để lừa người dùng. Thay vì khai thác lỗi gõ phím của con người, HalluSquatting nhắm vào những lỗi do mô hình AI tạo ra.
Tin tức này xuất hiện khi các nhà nghiên cứu tiếp tục thử nghiệm cách kẻ tấn công có thể thao túng các tác nhân AI.
Vào tháng 4, các nhà nghiên cứu của Google đã trình bày chi tiết các trang web độc hại được thiết kế để chiếm quyền điều khiển các tác nhân AI thông qua các cuộc tấn công chèn lệnh gián tiếp (indirect prompt injection attacks), bao gồm các nỗ lực đánh cắp mật khẩu, xóa tệp và thao túng thanh toán. Một nghiên cứu riêng về cuộc tấn công “CopyPasta” đã chỉ ra cách các lệnh ẩn (hidden prompts) bên trong các tệp nhà phát triển có thể thao túng các trợ lý lập trình AI để phát tán mã độc.
Vào tháng 6, một người dùng OpenClaw đã báo cáo phải đối mặt với hơn 6.000 nỗ lực từ những kẻ tấn công cố gắng lừa tác nhân AI rò rỉ thông tin nhạy cảm.