
OpenAI đã giới thiệu GPT-Red, một hệ thống AI tự động được thiết kế để tìm kiếm các lỗ hổng bảo mật trong các mô hình ngôn ngữ của mình.
GPT-Red lấy tên từ hoạt động red teaming trong an ninh mạng, là phương pháp cố ý tìm cách phá vỡ một hệ thống để xác định điểm yếu trước khi những kẻ tấn công có thể khai thác chúng.
Trong một bài đăng vào thứ Tư, OpenAI cho biết công cụ này đã giúp GPT-5.6 có khả năng chống lại các cuộc tấn công prompt injection tốt hơn trước khi triển khai.
“Khi khả năng của mô hình phát triển, an toàn và sự phù hợp cũng phải được mở rộng theo,” OpenAI viết trên X. “Red-teaming là điều cần thiết, nhưng các phương pháp hiện nay khó mở rộng, tạo ra một nút thắt cổ chai quan trọng. GPT‑Red là một cách chúng tôi đang giải quyết vấn đề này.”
Theo OpenAI, GPT-Red được đào tạo thông qua học tăng cường tự chơi (self-play reinforcement learning), tạo ra các cuộc tấn công prompt injection ngày càng mạnh mẽ hơn trong khi các mô hình phòng thủ học cách chống lại chúng. Công ty cho biết những cuộc tấn công đó đã được tích hợp vào quá trình đào tạo của GPT-5.6, báo cáo rằng GPT-Red đã thành công trong 84% các kịch bản đánh giá nội bộ, so với 13% của các đội red team là con người trong cùng các thử nghiệm.
“GPT‑Red học hỏi thông qua tự chơi đối kháng (adversarial self-play), nơi mục tiêu của nó là tấn công prompt injection vào nhiều mô hình phòng thủ thách thức khác nhau,” OpenAI viết. “Mọi cuộc tấn công thành công mà GPT-Red tìm thấy đều được sử dụng để cải thiện các mô hình phòng thủ này, thúc đẩy GPT‑Red liên tục tìm ra những lỗi rộng hơn và phức tạp hơn.”
Trong một nghiên cứu điển hình, OpenAI cho biết hệ thống đã thao túng một tác nhân máy bán hàng tự động để hạ giá, đặt hàng tồn kho giảm giá và hủy đơn hàng của một khách hàng khác trước khi các lỗ hổng được tiết lộ và khắc phục.
GPT-Red ra đời sau nhiều năm nỗ lực về an ninh mạng của OpenAI kể từ khi ChatGPT được ra mắt công khai.
Vào năm 2023, công ty đã ra mắt Mạng lưới Red Teaming của OpenAI, tuyển dụng các nhà nghiên cứu an ninh mạng và chuyên gia lĩnh vực bên ngoài để kiểm tra ChatGPT và các mô hình khác tìm kiếm các lỗi bảo mật trước khi phát hành. GPT-Red mở rộng nỗ lực đó bằng cách tự động hóa phần lớn quy trình, sử dụng mô hình AI để tạo ra các cuộc tấn công prompt injection và các bài kiểm tra đối kháng khác ở một quy mô mà các nhà nghiên cứu là con người khó có thể thực hiện một mình.
Thông báo của OpenAI phản ánh một sự chuyển dịch rộng rãi hơn sang việc sử dụng AI để bảo mật AI.
Đầu tháng này, Tổ chức Ethereum cho biết họ đã triển khai các tác nhân AI để red-team cơ sở hạ tầng mạng quan trọng, phát hiện ra một lỗ hổng trong phần mềm được sử dụng bởi các client đồng thuận của Ethereum. Các nhà nghiên cứu cho biết các tác nhân AI có thể tìm kiếm các cơ sở mã lớn hơn con người, nhưng thách thức đã chuyển từ việc tìm lỗi tiềm ẩn sang việc chứng minh lỗi nào có thể khai thác được.
Theo OpenAI, GPT-Red sẽ vẫn là một công cụ nội bộ vì nó chứa các khả năng tấn công được phát triển có chủ đích.
“Chúng tôi tin rằng với GPT-Red, chúng tôi đã bắt đầu mở khóa một vòng quay tương tự cho sự an toàn, nơi các mô hình hiện tại có thể được sử dụng để làm cho các mô hình trong tương lai mạnh mẽ hơn, phù hợp hơn và đáng tin cậy hơn,” họ nói.