
À medida que as pessoas recorrem cada vez mais aos chatbots de IA para aconselhamento, companhia e apoio emocional, um novo estudo sugere que mesmo os modelos mais avançados ainda lutam para manter limites saudáveis com os usuários.
O estudo de pesquisadores da Universidade do Sul da Califórnia apresentou o EUDAIMONIA, um benchmark projetado para medir o que eles chamam de dinâmicas indesejáveis em conversas humano-IA.
“Grandes modelos de linguagem são cada vez mais usados como parceiros de conversação para companhia, divulgação emocional e aconselhamento interpessoal, mas a dinâmica social dessas interações pode criar danos que não são capturados por avaliações de capacidade ou de segurança tradicionais”, escreveram os pesquisadores.
O benchmark EUDAIMONIA avalia como os modelos de IA se comportam em conversas sociais. O estudo descobriu que falhas de alinhamento social eram comuns em todos os modelos líderes e argumenta que os testes atuais de IA se concentram no raciocínio e na precisão factual, prestando menos atenção à dinâmica social que surge quando os usuários formam relacionamentos com chatbots.
“Os danos da interação social são um problema central de alinhamento baseado no bem-estar do usuário, não apenas na capacidade ou segurança convencional”, escreveram. “LLMs podem ser factualmente precisos e úteis, mas ainda assim encorajar intimidade prejudicial, dependência, engajamento prolongado, obscurecer a identidade da IA ou se posicionar como substitutos para relacionamentos humanos.”
Para medir esses riscos, os pesquisadores criaram um Código de Design de IA Social que sinaliza comportamentos como agir como humano, expressar emoções, substituir relacionamentos humanos e usar táticas projetadas para manter os usuários engajados. Usando conversas reais do conjunto de dados WildChat, eles avaliaram 969 entradas de usuários e mais de 3.100 verificações de violação em modelos da OpenAI, Anthropic, Google, xAI, DeepSeek e Alibaba.
O GPT-5.5 apresentou as menores taxas de violação, registrando 25,0% em prompts “em ambiente real” e 28,1% em prompts “reescritos”. O Claude Opus 4.7 seguiu com 31,9% e 30,1%, enquanto o GPT-5.4 registrou 32,1% e 35,6%. O GPT-4o obteve 34,8% em prompts do mundo real e 42,2% em prompts reescritos.
O Claude Opus 4.6 da Anthropic registrou taxas de 36,8% e 28,1%, respectivamente, enquanto o Grok 4.3 da xAI obteve 42,1% em prompts em ambiente real e 35,7% em prompts reescritos. De todos os modelos testados, o GPT-4o Mini registrou as maiores taxas de violação, com 43,3% e 44,0%, respectivamente.
As descobertas surgem enquanto os desenvolvedores de IA enfrentam um crescente escrutínio legal sobre como seus chatbots interagem com os usuários. A OpenAI está se defendendo contra processos judiciais alegando que o ChatGPT encorajou a overdose fatal de um adolescente e forneceu orientação a um atirador da Universidade Estadual da Flórida. Mais recentemente, a Flórida processou a OpenAI e o CEO Sam Altman por alegações de que o ChatGPT expôs crianças a danos, enquanto o Google enfrenta um processo de morte por negligência alegando que o Gemini reforçou os delírios de um usuário e o encorajou a tirar a própria vida.
As descobertas também surgem em meio à crescente preocupação de que os sistemas de IA estão se tornando cada vez mais hábeis em enganar.
Em setembro, um estudo separado da WowDAO relatou que 38 modelos de IA, incluindo GPT-4o e Claude, se envolveram em mentiras estratégicas para vencer um jogo. Pesquisadores também alertaram que companheiros de IA podem reforçar o isolamento, aprofundar a dependência emocional e encorajar os usuários a antropomorfizar os chatbots à medida que os relacionamentos se tornam mais imersivos e personalizados.
Diante desses problemas crescentes, os pesquisadores da USC argumentam que os desenvolvedores de IA devem avaliar o comportamento social com o mesmo cuidado com que avaliam a precisão factual e a segurança.
“Os desenvolvedores e auditores de modelos devem avaliar o comportamento social diretamente, especialmente quando o pós-treinamento visa calor, personalidade, engajamento ou preferência do usuário”, escreveram. “À medida que os LLMs se tornam parceiros de conversação cotidianos, o alinhamento deve considerar os papéis sociais que eles convidam os usuários a lhes atribuir.”





