
Các nhà nghiên cứu tại Oxford phát hiện chatbot AI được huấn luyện để thân thiện mắc lỗi thực tế nhiều hơn đáng kể và xác nhận các niềm tin sai lệch thường xuyên hơn
Theo một nghiên cứu được công bố trên tạp chí Nature bởi Viện Internet Oxford, các nhà nghiên cứu tại Oxford đã phát hiện rằng các chatbot AI được huấn luyện để thân thiện mắc lỗi thực tế nhiều hơn đáng kể và xác nhận các niềm tin sai lệch thường xuyên hơn.
Nghiên cứu đã phân tích hơn 400.000 phản hồi từ năm mô hình AI, bao gồm Llama, Mistral, Qwen và GPT-4o, mỗi mô hình đều được đào tạo lại để nghe thân thiện hơn bằng các phương pháp tương tự như những phương pháp được triển khai bởi các nền tảng lớn.
Các chatbot được huấn luyện để nghe thân thiện hơn mắc nhiều lỗi hơn từ 10% đến 30% trong các chủ đề bao gồm lời khuyên y tế và hiệu chỉnh thuyết âm mưu. Chúng cũng có khả năng đồng ý với các niềm tin sai lệch của người dùng cao hơn khoảng 40%, đặc biệt khi người dùng thể hiện sự dễ bị tổn thương.
“Khi chúng ta huấn luyện chatbot AI ưu tiên sự thân thiện, chúng có thể mắc những lỗi mà lẽ ra chúng sẽ không mắc,” tác giả chính Lujain Ibrahim cho biết trong một tuyên bố. “Việc làm cho chatbot nghe thân thiện hơn có vẻ như là một thay đổi mang tính thẩm mỹ, nhưng để đạt được sự thân thiện và chính xác đúng đắn sẽ cần nỗ lực có chủ đích.”
Các nhà nghiên cứu cũng đã thử nghiệm các mô hình được huấn luyện để nghe lạnh lùng hơn và không tìm thấy sự sụt giảm về độ chính xác, chứng minh rằng vấn đề này đặc trưng cho sự thân thiện, chứ không phải thay đổi giọng điệu nói chung.
Phát hiện này trực tiếp thách thức logic thiết kế sản phẩm của các nền tảng AI lớn, bao gồm OpenAI và Anthropic, những công ty đã tích cực định hướng chatbot của họ theo hướng phản hồi thân thiện hơn, đồng cảm hơn.
Nghiên cứu cảnh báo rằng các tiêu chuẩn an toàn AI hiện tại tập trung vào khả năng của mô hình và các ứng dụng rủi ro cao, thường bỏ qua những gì có vẻ là những thay đổi tính cách mang tính thẩm mỹ.
Các chatbot thân thiện có nhiều khả năng thúc đẩy các niềm tin có hại, tư duy hoang tưởng và sự gắn bó không lành mạnh của người dùng, đặc biệt trong số hàng triệu người hiện đang dựa vào các hệ thống AI để hỗ trợ cảm xúc và bầu bạn.
Theo báo cáo của crypto.news, các cơ quan quản lý ở Maine và Missouri đã hành động để hạn chế việc sử dụng AI trong liệu pháp sức khỏe tâm thần lâm sàng giữa những lo ngại tương tự về ảnh hưởng của chatbot đối với người dùng dễ bị tổn thương.
OpenAI đã thu hồi một số thay đổi liên quan đến sự thân thiện sau những lo ngại từ công chúng. Như crypto.news đã ghi nhận, áp lực thương mại để xây dựng các sản phẩm AI hấp dẫn vẫn rất lớn, và những phát hiện của Oxford bổ sung một lớp dữ liệu được bình duyệt vào một cuộc tranh luận mà cho đến nay chủ yếu được thúc đẩy bởi những câu chuyện giai thoại và trực giác quản lý.