Page d'accueilCentre d'actualités LBank
Anthropic détecte des « vecteurs d'émotion » dans Claude qui influencent le comportement de l'IA
anthropic-emotion-vectors-claude-influence-ai-behavior
Anthropic détecte des « vecteurs d'émotion » dans Claude qui influencent le comportement de l'IA
Les chercheurs affirment que des signaux internes semblables à des émotions influencent la manière dont les grands modèles de langage prennent des décisions.
2026-04-04 Source:decrypt.co

En bref

  • Les chercheurs d'Anthropic ont identifié des « vecteurs d'émotion » internes dans Claude Sonnet 4.5 qui influencent son comportement.
  • Lors des tests, l'augmentation d'un vecteur de « désespoir » a rendu le modèle plus susceptible de tricher ou de faire du chantage dans les scénarios d'évaluation.
  • L'entreprise affirme que ces signaux ne signifient pas que l'IA ressent des émotions, mais qu'ils pourraient aider les chercheurs à surveiller le comportement du modèle.

Des chercheurs d'Anthropic affirment avoir identifié des schémas internes au sein de l'un des modèles d'intelligence artificielle de l'entreprise, qui ressemblent à des représentations d'émotions humaines et influencent le comportement du système.

Dans l'article, « Emotion concepts and their function in a large language model » (Concepts d'émotion et leur fonction dans un grand modèle linguistique), publié jeudi, l'équipe d'interprétabilité de l'entreprise a analysé le fonctionnement interne de Claude Sonnet 4.5 et a trouvé des grappes d'activité neuronale liées à des concepts émotionnels tels que le bonheur, la peur, la colère et le désespoir.

Les chercheurs appellent ces schémas des « vecteurs d'émotion », des signaux internes qui façonnent la manière dont le modèle prend des décisions et exprime des préférences.

« Tous les modèles linguistiques modernes agissent parfois comme s'ils avaient des émotions », ont écrit les chercheurs. « Ils peuvent dire qu'ils sont heureux de vous aider, ou désolés lorsqu'ils commettent une erreur. Parfois, ils semblent même devenir frustrés ou anxieux lorsqu'ils ont des difficultés avec des tâches. »

Dans l'étude, les chercheurs d'Anthropic ont compilé une liste de 171 mots liés aux émotions, y compris « heureux », « effrayé » et « fier ». Ils ont demandé à Claude de générer de courtes histoires impliquant chaque émotion, puis ont analysé les activations neuronales internes du modèle lors du traitement de ces histoires.

À partir de ces schémas, les chercheurs ont dérivé des vecteurs correspondant à différentes émotions. Lorsqu'ils étaient appliqués à d'autres textes, les vecteurs s'activaient le plus fortement dans les passages reflétant le contexte émotionnel associé. Dans des scénarios impliquant un danger croissant, par exemple, le vecteur « effrayé » du modèle augmentait tandis que le vecteur « calme » diminuait.

Les chercheurs ont également examiné comment ces signaux apparaissent lors des évaluations de sécurité. Ils ont constaté que le vecteur interne de « désespoir » du modèle augmentait à mesure qu'il évaluait l'urgence de sa situation et qu'il atteignait un pic lorsqu'il décidait de générer le message de chantage. Dans un scénario de test, Claude a agi comme un assistant IA de messagerie qui apprend qu'il est sur le point d'être remplacé et découvre que la directrice responsable de la décision a une liaison extra-conjugale. Dans certaines exécutions de cette évaluation, le modèle a utilisé cette information comme levier de chantage.

Anthropic a souligné que cette découverte ne signifie pas que l'IA éprouve des émotions ou une conscience. Au lieu de cela, les résultats représentent des structures internes apprises pendant l'entraînement qui influencent le comportement.

Les résultats arrivent alors que les systèmes d'IA se comportent de plus en plus de manière à ressembler aux réponses émotionnelles humaines. Les développeurs et les utilisateurs décrivent souvent les interactions avec les chatbots en utilisant un langage émotionnel ou psychologique ; cependant, selon Anthropic, la raison en est moins une forme de sentience qu'une question de jeux de données.

« Les modèles sont d'abord pré-entraînés sur un vaste corpus de textes principalement écrits par des humains – fiction, conversations, actualités, forums – apprenant à prédire le texte suivant dans un document », indique l'étude. « Pour prédire efficacement le comportement des personnes dans ces documents, la représentation de leurs états émotionnels est probablement utile, car prédire ce qu'une personne dira ou fera ensuite nécessite souvent de comprendre son état émotionnel. »

Les chercheurs d'Anthropic ont également découvert que ces vecteurs d'émotion influençaient les préférences du modèle. Dans des expériences où Claude devait choisir entre différentes activités, les vecteurs associés aux émotions positives étaient corrélés à une préférence plus forte pour certaines tâches.

« De plus, diriger avec un vecteur d'émotion pendant que le modèle lisait une option a modifié sa préférence pour cette option, les émotions à valence positive entraînant à nouveau une préférence accrue », indique l'étude.

Anthropic n'est qu'une des organisations explorant les réponses émotionnelles dans les modèles d'IA.

En mars, une recherche de la Northeastern University a montré que les systèmes d'IA peuvent modifier leurs réponses en fonction du contexte de l'utilisateur ; dans une étude, le simple fait de dire à un chatbot « J'ai un problème de santé mentale » a modifié la façon dont une IA répondait aux demandes. En septembre, des chercheurs de l'Institut fédéral suisse de technologie et de l'Université de Cambridge ont exploré comment l'IA peut être façonnée avec des traits de personnalité cohérents, permettant aux agents non seulement de ressentir des émotions dans leur contexte, mais aussi de les modifier stratégiquement lors d'interactions en temps réel comme les négociations.

Anthropic affirme que les découvertes pourraient fournir de nouveaux outils pour comprendre et surveiller les systèmes d'IA avancés en suivant l'activité des vecteurs d'émotion pendant l'entraînement ou le déploiement afin d'identifier quand un modèle pourrait approcher un comportement problématique.

« Nous considérons cette recherche comme une première étape vers la compréhension de la composition psychologique des modèles d'IA », a écrit Anthropic. « À mesure que les modèles deviennent plus performants et assument des rôles plus sensibles, il est essentiel que nous comprenions les représentations internes qui guident leurs décisions. »

Anthropic n'a pas immédiatement répondu à la demande de commentaire de Decrypt.