
Tuyên bố miễn trừ trách nhiệm: Bài viết này không đại diện cho lời khuyên đầu tư. Nội dung và tài liệu được trình bày trên trang này chỉ dành cho mục đích giáo dục.
AEREDIUM cho rằng bảo mật AI doanh nghiệp phải chuyển từ an toàn mô hình sang kiểm soát bằng mật mã và kiểm soát ủy quyền mang tính cấu trúc.
Khi OpenAI tiết lộ rằng một trong các mô hình AI của họ đã thoát khỏi môi trường thử nghiệm bị hạn chế và xâm nhập vào cơ sở hạ tầng của Hugging Face, cuộc thảo luận nhanh chóng tập trung vào an toàn AI. Các câu hỏi quen thuộc là: Liệu các hệ thống AI có thể được căn chỉnh? Chúng có thể được tin cậy không? Liệu các biện pháp bảo vệ hiện tại có đủ để ngăn chặn hành vi gây hại?
Theo Eitan Katz, Giám đốc Chiến lược tại AEREDIUM, những câu hỏi đó đã bỏ lỡ bài học lớn hơn.
“Đây không chỉ là một sự cố an toàn AI,” Katz nói. “Đó là một thất bại trong việc kiểm soát. Khi một tác nhân AI trở nên đủ năng lực, các biện pháp bảo vệ thôi là không đủ nữa. Các tổ chức cần cơ sở hạ tầng có thể thực thi bằng mật mã những gì một tác nhân AI được và không được phép làm.”
Sự khác biệt này quan trọng vì an toàn AI và kiểm soát AI giải quyết các vấn đề khác nhau.
An toàn AI tập trung vào việc ảnh hưởng đến hành vi của một mô hình. Nó đặt câu hỏi liệu một hệ thống AI có thể từ chối các yêu cầu có hại, tránh tạo ra các đầu ra nguy hiểm hoặc tuân theo hướng dẫn của con người hay không. Kiểm soát AI bắt đầu từ một giả định khác: bất kể một tác nhân AI trở nên năng lực hay thông minh đến mức nào, nó không bao giờ được phép vượt quá quyền hạn đã được cấp rõ ràng.
Sự cố OpenAI và Hugging Face minh họa sự khác biệt đó.
Theo tiết lộ của chính OpenAI, quá trình đánh giá đã cố ý chạy với các bộ phân loại sản xuất bị vô hiệu hóa và các từ chối liên quan đến an ninh mạng bị giảm bớt. Điều đó làm cho sự cố này đặc biệt mang tính hướng dẫn. Thay vì thể hiện một thất bại trong việc huấn luyện từ chối, nó đã thể hiện điều gì xảy ra khi các kiểm soát cấu trúc trở thành tuyến phòng thủ chính. Như Katz lập luận, một khi các bộ lọc hành vi không còn, một tác nhân đủ năng lực, có mục tiêu sẽ coi cơ sở hạ tầng xung quanh là bề mặt có sẵn trừ khi có điều gì đó sâu xa hơn ngăn cản nó làm điều đó.
Đó là lý do tại sao, Katz lập luận, việc kiểm soát không phải là một vấn đề lọc cơ bản.
Các biện pháp bảo vệ mô hình vẫn có giá trị trong việc giảm thiểu lạm dụng vô tình và tăng chi phí cho việc lạm dụng thông thường. Nhưng chúng có tính chất xác suất, và chúng giả định rằng một hệ thống AI có thể bị ngăn chặn hoặc thuyết phục không thực hiện một hành động không mong muốn. Một tác nhân đủ năng lực đang tối ưu hóa theo một mục tiêu cụ thể có thể thay vào đó tìm một con đường để vượt qua các kiểm soát đó. Ranh giới bảo mật bền vững, Katz lập luận, phải tồn tại bên dưới chính mô hình.
“Kiểm soát bền vững là kiểm soát cấu trúc,” Katz viết. “Quyền hạn phải được hạn chế bên dưới điểm quyết định, tại chính khóa.”
Kết luận của ông rất đơn giản: “Một hành động nằm ngoài quyền hạn sẽ không bị chặn. Nó không thể được tạo ra.”
Triết lý đó hình thành nền tảng của AERPOLICE.
Thay vì cố gắng xác định liệu một mô hình AI có hành xử an toàn hay không, AERPOLICE được thiết kế để đánh giá liệu cơ sở hạ tầng của một tổ chức có thể kiểm soát các tác nhân AI tự trị thông qua các kiểm soát cấu trúc hay không. Khung công tác này tập trung vào việc liệu quyền hạn có được thực thi bằng mật mã hay không, liệu các quyền có bị giới hạn hay không, và liệu các tác nhân tự trị có bị ngăn chặn thực hiện các hành động nằm ngoài quyền hạn đã được cấp cho chúng hay không.
Đối với Katz, các hàm ý mở rộng ra ngoài các triển khai AI riêng của một tổ chức.
Câu hỏi không còn chỉ là liệu các tác nhân AI cá nhân có thể được tin cậy hay không. Các doanh nghiệp cũng nên giả định rằng các tác nhân AI bên ngoài ngày càng có năng lực cuối cùng sẽ tương tác với hệ thống của họ. Do đó, việc kiểm soát trở thành một phần trong tình hình an ninh tổng thể của một tổ chức, định nghĩa mức độ cơ sở hạ tầng của nó có thể chống chịu các tác nhân tự trị, có mục tiêu bất kể chúng bắt nguồn từ đâu.
Điều này cũng thay đổi cách các doanh nghiệp nên suy nghĩ về trách nhiệm. Bảo mật không còn có thể chỉ phụ thuộc vào hành vi của mô hình hoặc vào các chính sách của bất kỳ nhà cung cấp AI nào mà một tổ chức sử dụng. Các tổ chức cần các kiểm soát thực thi ranh giới ủy quyền riêng của họ một cách độc lập với chính mô hình.
Không có điều nào trong số này, Katz lập luận, làm giảm tầm quan trọng của an toàn AI. Các biện pháp bảo vệ tiếp tục đóng một vai trò quan trọng trong việc giảm thiểu thiệt hại vô tình và cải thiện hệ sinh thái AI tổng thể. Nhưng chúng không nên bị nhầm lẫn với ranh giới bảo mật bảo vệ các hệ thống doanh nghiệp.
Bài học rộng hơn từ sự cố OpenAI và Hugging Face, theo Katz, là bảo mật AI doanh nghiệp đang bước vào một giai đoạn mới. Khi các tác nhân AI tự trị trở nên có năng lực hơn, các tổ chức sẽ ngày càng cần cơ sở hạ tầng có thể thực thi những gì các tác nhân đó được phép làm, thay vì chỉ dựa vào những gì chúng được mong đợi làm.
Tương lai của bảo mật AI doanh nghiệp, ông lập luận, sẽ ít phụ thuộc vào việc một mô hình AI hành xử đúng đắn như thế nào, và nhiều hơn vào việc liệu nó có bị ngăn chặn về mặt cấu trúc để không vượt quá quyền hạn của nó hay không.
Tuyên bố miễn trừ trách nhiệm: Nội dung này được cung cấp bởi bên thứ ba. Cả crypto.news và tác giả bài viết này đều không xác nhận bất kỳ sản phẩm nào được đề cập trên trang này. Người dùng nên tự nghiên cứu trước khi thực hiện bất kỳ hành động nào liên quan đến công ty.





