
Anthropic đã đề xuất các khuôn khổ chính sách AI mới khi các hệ thống tiên tiến đạt được khả năng mạnh mẽ hơn.
Công ty mong muốn chính phủ đặt ra các quy tắc cho các mô hình tiên phong và chuẩn bị cho người lao động về tác động kinh tế của AI. Kế hoạch của họ bao gồm các triển khai nguy hiểm, kiểm thử độc lập, an ninh mạng và khả năng phục hồi của cộng đồng.
Anthropic đã giới thiệu hai đề xuất trong kế hoạch “Chính sách về sự bùng nổ AI” của mình. Khuôn khổ AI tiên tiến tập trung vào các mô hình mạnh mẽ, trong khi Khuôn khổ chính sách kinh tế đề cập đến người lao động và lợi ích tài chính chung. Công ty lập luận rằng AI hiện đang phát triển nhanh hơn các hệ thống hoạch định chính sách hiện tại. Họ cũng cho rằng chính phủ cần có thẩm quyền để chặn hoặc ngăn chặn các triển khai mô hình nguy hiểm.
Theo kế hoạch, các hình phạt dân sự sẽ gắn liền với doanh thu hàng năm toàn cầu. Các vi phạm lặp lại sẽ phải chịu các hình phạt nặng hơn, dựa trên khuôn khổ đề xuất. Khuôn khổ này cũng kêu gọi các nhà phát triển tiên phong thử nghiệm các mô hình trước khi phát hành. Các nhà phát triển sẽ công bố các bản tóm tắt, khuôn khổ an toàn và thẻ hệ thống cho các hệ thống AI mạnh mẽ.
Các nhà đánh giá độc lập sẽ xem xét các thử nghiệm mô hình và báo cáo rủi ro. Anthropic cũng muốn các nhà phát triển duy trì các chương trình bảo mật mạnh mẽ cho trọng số mô hình và hệ thống đào tạo. Đề xuất này ủng hộ các luật minh bạch ở các bang như California và New York. Tuy nhiên, công ty lập luận rằng việc tiết lộ công khai đơn thuần không còn theo kịp tốc độ phát triển của AI.
Các quy tắc được đề xuất sẽ chỉ áp dụng cho các hệ thống AI tiên tiến nhất. Anthropic đặt ngưỡng cho các mô hình được đào tạo trên 10²⁵ phép toán dấu phẩy động. Khuôn khổ này cũng sẽ bao gồm các công ty có doanh thu liên quan đến AI hơn 500 triệu đô la. Các công ty chi hơn 1 tỷ đô la cho nghiên cứu và phát triển AI cũng sẽ thuộc phạm vi này.
Anthropic đã nêu tên bốn lĩnh vực rủi ro chính trong đề xuất. Chúng bao gồm rủi ro sinh học, rủi ro mạng, mất kiểm soát và nghiên cứu AI tự động. Đối với rủi ro sinh học, công ty cảnh báo rằng các hệ thống không an toàn có thể giúp kẻ tấn công phát triển các loại virus có hại. Họ cũng lưu ý rằng các công cụ AI tương tự có thể hỗ trợ khám phá thuốc.
Đối với rủi ro mạng, các mô hình tiên phong có thể tìm thấy các lỗ hổng phần mềm nghiêm trọng ở quy mô lớn. Anthropic cho biết những khả năng này làm dấy lên mối lo ngại cho các bệnh viện, lưới điện và các hệ thống quan trọng khác. Công ty cũng nhấn mạnh các rủi ro từ các hệ thống hoạt động ngoài tầm kiểm soát của nhà phát triển. Nghiên cứu AI tự động có thể làm tăng các rủi ro sinh học, mạng và kiểm soát nếu các biện pháp bảo vệ thất bại.
Anthropic muốn các nhà phát triển tiên phong công bố các báo cáo rủi ro thường xuyên. Các báo cáo này sẽ mô tả tình hình rủi ro tổng thể của nhà phát triển và công việc an toàn mô hình. Khuôn khổ này cũng kêu gọi ít nhất một nhà đánh giá độc lập đủ tiêu chuẩn. Nhà đánh giá đó sẽ xem xét các đánh giá của công ty và công bố các phát hiện trên các báo cáo rủi ro mô hình.
Các chính phủ và ngành công nghiệp cũng sẽ đặt ra các tiêu chuẩn cho những nhà đánh giá đó. Đề xuất nói rằng các nhà đánh giá cần được tài trợ và tiếp cận các mô hình tiên phong. Các quy tắc bảo mật tạo thành một phần quan trọng khác của khuôn khổ. Các nhà phát triển sẽ bảo vệ toàn bộ môi trường phát triển của họ khỏi những kẻ tấn công bên ngoài và các mối đe dọa nội bộ.
Các công ty sẽ mô tả các chương trình bảo mật của họ một cách công khai ở cấp độ cao. Họ cũng sẽ chia sẻ thêm chi tiết với một cơ quan chính phủ được chỉ định khi được yêu cầu. Anthropic cho biết các nhà hoạch định chính sách có thể bắt đầu với các quy tắc nhẹ hơn và điều chỉnh chúng theo thời gian. Khuôn khổ nói rằng quy định nên tuân theo khả năng mô hình và các tiêu chuẩn đánh giá.
Phần thứ hai của khuôn khổ tập trung vào khả năng phục hồi của cộng đồng. Anthropic khuyến nghị lập kế hoạch mạnh mẽ hơn cho các rủi ro AI liên quan đến sinh học, mạng và kiểm soát. Đối với sinh học, đề xuất bao gồm sàng lọc tổng hợp gen và giám sát sinh học cảnh báo sớm. Nó cũng đề cập đến việc dự trữ thiết bị bảo hộ và các công cụ để giảm lây truyền trong không khí.
Đối với mạng, khuôn khổ kêu gọi phần mềm internet mạnh mẽ hơn và hỗ trợ cho các nhà khai thác cơ sở hạ tầng quan trọng. Nó cũng khuyến nghị thay thế các hệ thống cũ trong cơ sở hạ tầng thiết yếu. Các chính phủ cũng nên theo dõi các khả năng mạng tiên phong thông qua một chức năng chuyên biệt. Anthropic đề xuất hợp tác giữa chính phủ và ngành công nghiệp về các biện pháp bảo vệ mô hình.
Công ty cho biết công việc về rủi ro mất kiểm soát và nghiên cứu tự động vẫn còn ít được phát triển. Nó kêu gọi các công cụ tốt hơn để phát hiện, ngăn chặn hoặc tắt các hệ thống không an toàn. Anthropic thúc giục các nhà hoạch định chính sách hành động khi khả năng mô hình tiếp tục cải thiện. Công ty cho biết quản trị AI phải theo kịp với công nghệ.