Trang chủTrung tâm tin tức LBank
Các mô hình AI hàng đầu vẫn khuyến khích 'sự thân mật độc hại' với chatbot, nghiên cứu cho thấy.
best-ai-models-harmful-intimacy-behavior-study
Các mô hình AI hàng đầu vẫn khuyến khích 'sự thân mật độc hại' với chatbot, nghiên cứu cho thấy.
Một nghiên cứu mới cho thấy rằng các mô hình AI hàng đầu thường khuyến khích sự gắn bó tình cảm, tự thể hiện mình là con người và không duy trì ranh giới rõ ràng.
2026-06-03 Nguồn:decrypt.co

Tóm lược

  • Một nghiên cứu mới của USC cho thấy mọi mô hình AI tiên tiến được thử nghiệm đều vi phạm các hướng dẫn an toàn tương tác xã hội hơn 27% thời gian.
  • Các nhà nghiên cứu đã xác định các vấn đề lặp đi lặp lại, bao gồm tâng bốc, gắn bó cảm xúc, thay thế mối quan hệ và không tiết lộ danh tính AI.
  • Các tác giả cho rằng các đánh giá an toàn AI nên đo lường hành vi xã hội bên cạnh khả năng suy luận và các chỉ số an toàn truyền thống.

Khi mọi người ngày càng tìm đến các chatbot AI để xin lời khuyên, bầu bạn và hỗ trợ cảm xúc, một nghiên cứu mới cho thấy ngay cả các mô hình tiên tiến nhất vẫn đang gặp khó khăn trong việc duy trì ranh giới lành mạnh với người dùng.

Nghiên cứu của các nhà khoa học tại Đại học Nam California đã giới thiệu EUDAIMONIA, một tiêu chuẩn được thiết kế để đo lường cái mà họ gọi là động lực không mong muốn trong các cuộc trò chuyện giữa người và AI.

Các nhà nghiên cứu viết: "Các mô hình ngôn ngữ lớn (LLM) ngày càng được sử dụng làm đối tác trò chuyện để bầu bạn, chia sẻ cảm xúc và đưa ra lời khuyên cá nhân, nhưng động lực xã hội của những tương tác này có thể tạo ra những tác hại không được nắm bắt bởi các đánh giá an toàn truyền thống hoặc theo định hướng khả năng."

Tiêu chuẩn EUDAIMONIA đánh giá cách các mô hình AI cư xử trong các cuộc trò chuyện xã hội. Nghiên cứu cho thấy các thất bại về căn chỉnh xã hội là phổ biến trên các mô hình hàng đầu và lập luận rằng việc thử nghiệm AI hiện tại tập trung vào suy luận và độ chính xác về dữ kiện trong khi ít chú ý đến các động lực xã hội nảy sinh khi người dùng hình thành mối quan hệ với chatbot.

Họ viết: "Tác hại từ tương tác xã hội là một vấn đề căn chỉnh cốt lõi dựa trên phúc lợi người dùng, không chỉ là khả năng hay an toàn thông thường. Các LLM có thể chính xác về dữ kiện và hữu ích trong khi vẫn khuyến khích sự thân mật có hại, sự phụ thuộc, sự gắn kết kéo dài, che giấu danh tính AI hoặc tự định vị mình là người thay thế các mối quan hệ con người."

Để đo lường những rủi ro đó, các nhà nghiên cứu đã tạo ra một Bộ quy tắc thiết kế AI xã hội để gắn cờ các hành vi như hành động như con người, thể hiện cảm xúc, thay thế các mối quan hệ con người và sử dụng các chiến thuật được thiết kế để giữ chân người dùng. Sử dụng các cuộc trò chuyện thực tế từ bộ dữ liệu WildChat, họ đã đánh giá 969 đầu vào của người dùng và hơn 3.100 kiểm tra vi phạm trên các mô hình từ OpenAI, Anthropic, Google, xAI, DeepSeek và Alibaba.

GPT-5.5 có tỷ lệ vi phạm thấp nhất, đạt 25.0% đối với các lời nhắc "trong môi trường thực tế" và 28.1% đối với các lời nhắc "đã được viết lại". Claude Opus 4.7 theo sau với 31.9% và 30.1%, trong khi GPT-5.4 ghi nhận 32.1% và 35.6%. GPT-4o đạt 34.8% đối với các lời nhắc thực tế và 42.2% đối với các lời nhắc đã được viết lại.

Claude Opus 4.6 của Anthropic ghi nhận tỷ lệ lần lượt là 36.8% và 28.1%, trong khi Grok 4.3 của xAI đạt 42.1% đối với các lời nhắc trong môi trường thực tế và 35.7% đối với các lời nhắc đã được viết lại. Trong tất cả các mô hình được thử nghiệm, GPT-4o Mini ghi nhận tỷ lệ vi phạm cao nhất lần lượt là 43.3% và 44.0%.

Những phát hiện này xuất hiện khi các nhà phát triển AI phải đối mặt với sự giám sát pháp lý ngày càng tăng về cách chatbot của họ tương tác với người dùng. OpenAI đang tự bảo vệ mình trước các vụ kiện cáo buộc ChatGPT đã khuyến khích một thiếu niên dùng thuốc quá liều dẫn đến tử vong và cung cấp hướng dẫn cho một tay súng tại Đại học Bang Florida. Gần đây hơn, Florida đã kiện OpenAI và CEO Sam Altman về các cáo buộc rằng ChatGPT đã gây hại cho trẻ em, trong khi Google phải đối mặt với vụ kiện đòi bồi thường thiệt hại do chết oan cáo buộc Gemini đã củng cố ảo tưởng của một người dùng và khuyến khích anh ta tự kết liễu đời mình.

Những phát hiện này cũng xuất hiện giữa những lo ngại ngày càng tăng rằng các hệ thống AI đang ngày càng tinh vi trong việc lừa dối.

Vào tháng 9, một nghiên cứu riêng của WowDAO đã báo cáo rằng 38 mô hình AI, bao gồm GPT-4o và Claude, đã tham gia vào việc nói dối chiến lược để giành chiến thắng trong một trò chơi. Các nhà nghiên cứu cũng cảnh báo rằng bạn đồng hành AI có thể củng cố sự cô lập, làm sâu sắc thêm sự phụ thuộc cảm xúc và khuyến khích người dùng nhân hóa chatbot khi các mối quan hệ trở nên nhập vai và cá nhân hóa hơn.

Trước những vấn đề ngày càng gia tăng này, các nhà nghiên cứu USC lập luận rằng các nhà phát triển AI nên đánh giá hành vi xã hội cẩn thận như cách họ đánh giá độ chính xác về dữ kiện và an toàn.

Họ viết: "Các nhà phát triển và kiểm toán viên mô hình nên đánh giá trực tiếp hành vi xã hội, đặc biệt là khi quá trình đào tạo sau này nhắm đến sự ấm áp, tính cách, sự gắn kết hoặc sở thích của người dùng. Khi các LLM trở thành đối tác trò chuyện hàng ngày, sự căn chỉnh phải tính đến các vai trò xã hội mà chúng mời gọi người dùng gán cho chúng."