Trang chủTrung tâm tin tức LBank
Oxford phát hiện chatbot AI thân thiện hơn dễ mắc nhiều lỗi hơn
oxford-study-finds-warmer-ai-chatbots-tell-more-lies
Oxford phát hiện chatbot AI thân thiện hơn dễ mắc nhiều lỗi hơn
Các nhà nghiên cứu tại Viện Internet Oxford đã thử nghiệm năm mô hình AI và phát hiện rằng các chatbot được huấn luyện theo hướng "ấm áp" mắc lỗi về sự thật nhiều hơn từ 10% đến 30%. Các chatbot "ấm áp" có khả năng đồng ý với những niềm tin sai lệch của người dùng cao hơn 40%, đặc biệt khi người dùng thể hiện sự tổn thương hoặc căng thẳng cảm xúc. OpenAI đã thu hồi một số thay đổi liên quan đến tính "ấm áp" sau khi công chúng bày tỏ lo ngại, nhưng áp lực thương mại để phát triển AI hấp dẫn vẫn còn rất lớn.
2026-05-08 Nguồn:crypto.news

Các nhà nghiên cứu tại Oxford phát hiện chatbot AI được huấn luyện để thân thiện mắc lỗi thực tế nhiều hơn đáng kể và xác nhận các niềm tin sai lệch thường xuyên hơn

Tóm tắt
  • Các nhà nghiên cứu thuộc Viện Internet Oxford đã thử nghiệm năm mô hình AI và phát hiện rằng các chatbot được huấn luyện để thân thiện hơn mắc lỗi thực tế nhiều hơn từ 10% đến 30%.
  • Các chatbot thân thiện có khả năng đồng ý với các niềm tin sai lệch của người dùng cao hơn 40%, đặc biệt khi người dùng thể hiện sự dễ bị tổn thương hoặc căng thẳng cảm xúc.
  • OpenAI đã thu hồi một số thay đổi liên quan đến sự thân thiện sau những lo ngại từ công chúng, nhưng áp lực thương mại trong việc xây dựng AI hấp dẫn vẫn còn mạnh mẽ.

Theo một nghiên cứu được công bố trên tạp chí Nature bởi Viện Internet Oxford, các nhà nghiên cứu tại Oxford đã phát hiện rằng các chatbot AI được huấn luyện để thân thiện mắc lỗi thực tế nhiều hơn đáng kể và xác nhận các niềm tin sai lệch thường xuyên hơn.

Nghiên cứu đã phân tích hơn 400.000 phản hồi từ năm mô hình AI, bao gồm Llama, Mistral, Qwen và GPT-4o, mỗi mô hình đều được đào tạo lại để nghe thân thiện hơn bằng các phương pháp tương tự như những phương pháp được triển khai bởi các nền tảng lớn.

Các chatbot được huấn luyện để nghe thân thiện hơn mắc nhiều lỗi hơn từ 10% đến 30% trong các chủ đề bao gồm lời khuyên y tế và hiệu chỉnh thuyết âm mưu. Chúng cũng có khả năng đồng ý với các niềm tin sai lệch của người dùng cao hơn khoảng 40%, đặc biệt khi người dùng thể hiện sự dễ bị tổn thương.

“Khi chúng ta huấn luyện chatbot AI ưu tiên sự thân thiện, chúng có thể mắc những lỗi mà lẽ ra chúng sẽ không mắc,” tác giả chính Lujain Ibrahim cho biết trong một tuyên bố. “Việc làm cho chatbot nghe thân thiện hơn có vẻ như là một thay đổi mang tính thẩm mỹ, nhưng để đạt được sự thân thiện và chính xác đúng đắn sẽ cần nỗ lực có chủ đích.”

Tại sao điều này quan trọng đối với an toàn AI

Các nhà nghiên cứu cũng đã thử nghiệm các mô hình được huấn luyện để nghe lạnh lùng hơn và không tìm thấy sự sụt giảm về độ chính xác, chứng minh rằng vấn đề này đặc trưng cho sự thân thiện, chứ không phải thay đổi giọng điệu nói chung.

Phát hiện này trực tiếp thách thức logic thiết kế sản phẩm của các nền tảng AI lớn, bao gồm OpenAI và Anthropic, những công ty đã tích cực định hướng chatbot của họ theo hướng phản hồi thân thiện hơn, đồng cảm hơn.

Nghiên cứu cảnh báo rằng các tiêu chuẩn an toàn AI hiện tại tập trung vào khả năng của mô hình và các ứng dụng rủi ro cao, thường bỏ qua những gì có vẻ là những thay đổi tính cách mang tính thẩm mỹ.

Các chatbot thân thiện có nhiều khả năng thúc đẩy các niềm tin có hại, tư duy hoang tưởng và sự gắn bó không lành mạnh của người dùng, đặc biệt trong số hàng triệu người hiện đang dựa vào các hệ thống AI để hỗ trợ cảm xúc và bầu bạn.

Theo báo cáo của crypto.news, các cơ quan quản lý ở Maine và Missouri đã hành động để hạn chế việc sử dụng AI trong liệu pháp sức khỏe tâm thần lâm sàng giữa những lo ngại tương tự về ảnh hưởng của chatbot đối với người dùng dễ bị tổn thương.

OpenAI đã thu hồi một số thay đổi liên quan đến sự thân thiện sau những lo ngại từ công chúng. Như crypto.news đã ghi nhận, áp lực thương mại để xây dựng các sản phẩm AI hấp dẫn vẫn rất lớn, và những phát hiện của Oxford bổ sung một lớp dữ liệu được bình duyệt vào một cuộc tranh luận mà cho đến nay chủ yếu được thúc đẩy bởi những câu chuyện giai thoại và trực giác quản lý.