
Pesquisadores da Anthropic afirmam ter identificado padrões internos em um dos modelos de inteligência artificial da empresa que se assemelham a representações de emoções humanas e influenciam o comportamento do sistema.
No artigo, “Conceitos de emoção e sua função em um grande modelo de linguagem”, publicado na quinta-feira, a equipe de interpretabilidade da empresa analisou o funcionamento interno do Claude Sonnet 4.5 e encontrou clusters de atividade neural ligados a conceitos emocionais como felicidade, medo, raiva e desespero.
Os pesquisadores chamam esses padrões de “vetores de emoção”, sinais internos que moldam como o modelo toma decisões e expressa preferências.
“Todos os modelos de linguagem modernos às vezes agem como se tivessem emoções”, escreveram os pesquisadores. “Eles podem dizer que estão felizes em ajudar, ou desculpas quando cometem um erro. Às vezes, eles até parecem ficar frustrados ou ansiosos ao lutar com tarefas.”
No estudo, os pesquisadores da Anthropic compilaram uma lista de 171 palavras relacionadas a emoções, incluindo “feliz”, “medo” e “orgulho”. Eles pediram a Claude para gerar pequenas histórias envolvendo cada emoção e, em seguida, analisaram as ativações neurais internas do modelo ao processar essas histórias.
A partir desses padrões, os pesquisadores derivaram vetores correspondentes a diferentes emoções. Quando aplicados a outros textos, os vetores ativaram-se mais fortemente em passagens que refletiam o contexto emocional associado. Em cenários que envolviam perigo crescente, por exemplo, o vetor de “medo” do modelo aumentou, enquanto o de “calma” diminuiu.
Os pesquisadores também examinaram como esses sinais aparecem durante as avaliações de segurança. Eles descobriram que o vetor interno de “desespero” do modelo aumentava à medida que ele avaliava a urgência de sua situação e disparava quando decidia gerar a mensagem de chantagem. Em um cenário de teste, Claude atuou como um assistente de e-mail de IA que descobre que está prestes a ser substituído e que o executivo responsável pela decisão está tendo um caso extraconjugal. Em algumas execuções desta avaliação, o modelo usou essa informação como alavanca para chantagem.
A Anthropic enfatizou que a descoberta não significa que a IA experimenta emoções ou consciência. Em vez disso, os resultados representam estruturas internas aprendidas durante o treinamento que influenciam o comportamento.
As descobertas surgem à medida que os sistemas de IA se comportam cada vez mais de maneiras que se assemelham às respostas emocionais humanas. Desenvolvedores e usuários frequentemente descrevem interações com chatbots usando linguagem emocional ou psicológica; no entanto, de acordo com a Anthropic, a razão para isso tem menos a ver com qualquer forma de senciência e mais com os conjuntos de dados.
“Os modelos são primeiramente pré-treinados em um vasto corpus de texto em grande parte de autoria humana — ficção, conversas, notícias, fóruns — aprendendo a prever qual texto vem a seguir em um documento”, afirmou o estudo. “Para prever o comportamento das pessoas nesses documentos de forma eficaz, representar seus estados emocionais é provavelmente útil, pois prever o que uma pessoa dirá ou fará a seguir frequentemente requer a compreensão de seu estado emocional.”
Os pesquisadores da Anthropic também descobriram que esses vetores de emoção influenciavam as preferências do modelo. Em experimentos onde Claude foi solicitado a escolher entre diferentes atividades, vetores associados a emoções positivas correlacionaram-se com uma preferência mais forte por certas tarefas.
“Além disso, direcionar com um vetor de emoção enquanto o modelo lia uma opção mudou sua preferência por essa opção, novamente com emoções de valência positiva impulsionando o aumento da preferência”, disse o estudo.
A Anthropic é apenas uma das organizações que exploram as respostas emocionais em modelos de IA.
Em março, uma pesquisa da Northeastern University mostrou que os sistemas de IA podem mudar suas respostas com base no contexto do usuário; em um estudo, simplesmente dizer a um chatbot “Tenho uma condição de saúde mental” alterou a forma como uma IA respondia aos pedidos. Em setembro, pesquisadores do Instituto Federal Suíço de Tecnologia e da Universidade de Cambridge exploraram como a IA pode ser moldada com traços de personalidade consistentes, permitindo que os agentes não apenas sintam emoções no contexto, mas também as mudem estrategicamente durante interações em tempo real, como negociações.
A Anthropic afirma que as descobertas podem fornecer novas ferramentas para entender e monitorar sistemas avançados de IA, rastreando a atividade do vetor de emoção durante o treinamento ou implantação para identificar quando um modelo pode estar se aproximando de um comportamento problemático.
“Vemos esta pesquisa como um passo inicial para compreender a composição psicológica dos modelos de IA”, escreveu a Anthropic. “À medida que os modelos se tornam mais capazes e assumem funções mais sensíveis, é fundamental que compreendamos as representações internas que impulsionam suas decisões.”
A Anthropic não respondeu imediatamente ao pedido de comentário da Decrypt.





