Page d'accueilCentre d'actualités LBank
Voici Claude Opus 4.8 d'Anthropic : Codage IA amélioré, sécurité plus intelligente — même prix exorbitant
anthropic-claude-opus-4-8-better-ai-coding-smarter-safety-huge-price
Voici Claude Opus 4.8 d'Anthropic : Codage IA amélioré, sécurité plus intelligente — même prix exorbitant
Le dernier modèle d'IA phare d'Anthropic, Claude Opus 4.8, arrive avec un raisonnement plus affûté, un alignement plus rigoureux et un prix qui n'a pas bougé.
2026-05-28 Source:decrypt.co

En bref

  • Anthropic a lancé Claude Opus 4.8 jeudi, seulement six semaines après Opus 4.7.
  • La mise à jour apporte des améliorations dans les benchmarks d'ingénierie logicielle, de raisonnement et d'utilisation informatique, au même prix de 5 $/25 $ par million de jetons d'entrée/sortie.
  • Les scores d'alignement d'Opus 4.8 sont désormais comparables à ceux de Claude Mythos Preview, le modèle frontalier restreint d'Anthropic, avec des taux de comportement trompeur ou propice à l'utilisation abusive nettement inférieurs à ceux de son prédécesseur.

Six semaines. C'est le temps qu'il a fallu à Anthropic pour passer d'Opus 4.7 à Opus 4.8.

Le nouveau modèle est plus rapide et plus intelligent lors des tests de référence, et est livré avec une suite de nouvelles fonctionnalités – mais le prix n'a pas bougé : il est de 5 $ par million de jetons d'entrée et de 25 $ par million de jetons de sortie, comme auparavant.

Il existe également un mode rapide qui exécute le même modèle 2,5 fois plus vite pour 10 $ d'entrée et un énorme 50 $ de sortie par million. Anthropic affirme que ce tarif est désormais trois fois moins cher que ce que coûtait le mode rapide sur les modèles précédents, ce qui est une jolie façon de dire que c'était beaucoup plus cher avant.

SWE-bench Pro est probablement le benchmark le plus important à surveiller pour se faire une idée de la qualité de ce modèle. Il mesure si une IA peut réellement résoudre des problèmes complexes d'ingénierie logicielle multilingues issus de bases de code de production réelles — scorés en pourcentage de problèmes résolus.

Sur ce test, Opus 4.8 a atteint 69,2%, contre 64,3% pour Opus 4.7. GPT-5.5 d'OpenAI a obtenu 58,6%, et Gemini 3.1 Pro de Google a suivi à 54,2%. Pour un modèle au même prix, c'est un bond significatif.

Sur Humanity's Last Exam — des questions de niveau expert couvrant des dizaines de disciplines universitaires, scorées en pourcentage de bonnes réponses — Opus 4.8 a atteint 49,8% sans outils et 57,9% avec, devant les trois rivaux. OSWorld-Verified, qui teste les tâches d'utilisation informatique réelles comme la navigation dans les interfaces logicielles, a enregistré 83,4%, dépassant légèrement le score d'Opus 4.7 de 82,8%.

Le seul échec : Terminal-Bench 2.1, qui mesure les performances de l'IA sur les tâches en ligne de commande. GPT-5.5 mène à 78,2%, tandis qu'Opus 4.8 marque 74,6% — mieux que les 66,1% d'Opus 4.7 et devant les 70,3% de Gemini, mais la deuxième place reste une défaite.

Cinq façons de penser

Anthropic permet désormais aux utilisateurs de contrôler le niveau de "réflexion" du modèle. "High" est la valeur par défaut et gère bien la plupart des tâches, tandis que "Extra" — appelé "xhigh" dans Claude Code — utilise plus de puissance de calcul pour les problèmes plus difficiles. "Max" est le niveau le plus élevé. "Low" et "Medium" dédient moins de jetons à la même tâche, ce qui permet de gagner du temps au détriment de la précision.

Le contrôle de l'effort est situé à côté du sélecteur de modèle dans claude.ai et Cowork, disponible sur tous les plans. Anthropic affirme que le mode "high" par défaut utilise à peu près les mêmes jetons que le mode par défaut d'Opus 4.7 avec de meilleurs résultats — ce qui est soit une ingénierie impressionnante, soit une bonne communication, et probablement les deux.

Il est également important de se rappeler que le nouveau tokenizer d'Anthropic pour Opus utilise plus de jetons par tâche. Les utilisateurs de Claude sont donc inévitablement tenus de dépenser beaucoup plus d'argent pour accomplir leurs tâches, s'ils choisissent Opus au lieu de Claude Sonnet – un modèle moins performant, mais probablement suffisant pour les tâches quotidiennes et les problèmes complexes qui n'atteignent pas le niveau de la science ou du codage de pointe.

Les limites de débit dans Claude Code ont également été augmentées pour absorber la consommation de jetons plus élevée générée par les paramètres Extra et Max.

Presque aussi sûr que Claude Mythos

L'équipe d'alignement d'Anthropic a déclaré qu'Opus 4.8 "atteint de nouveaux sommets en ce qui concerne nos mesures des traits prosociaux, tels que le soutien à l'autonomie de l'utilisateur et l'action dans le meilleur intérêt de l'utilisateur". Plus concrètement : les taux de tromperie et de coopération aux abus sont nettement inférieurs à ceux d'Opus 4.7, et comparables à Claude Mythos Preview — le modèle le plus restreint d'Anthropic.

Opus 4.8 est également quatre fois moins susceptible que 4.7 de laisser passer des bugs dans son propre code sans les signaler.

Cette comparaison avec Mythos mérite un éclaircissement. Mythos est un niveau entièrement supérieur à Opus – Anthropic le décrit comme "plus grand et plus intelligent que nos modèles Opus". Il n'existe actuellement qu'en version préliminaire, accessible à une poignée d'organisations vérifiées effectuant des travaux de cybersécurité via Project Glasswing.

L'AI Security Institute du Royaume-Uni a découvert qu'il pouvait effectuer de manière autonome "The Last Ones", une simulation d'attaque de réseau d'entreprise en 32 étapes qui prend habituellement 20 heures aux équipes de sécurité humaines. C'est pourquoi il n'est pas encore commercialisé. Anthropic affirme que des mesures de cybersécurité plus robustes sont en cours de développement, et s'attend à rendre les modèles de classe Mythos accessibles à tous "dans les semaines à venir".

Également lancé aujourd'hui : les workflows dynamiques dans Claude Code, en aperçu de recherche. Cette fonctionnalité permet à Claude d'écrire ses propres scripts d'orchestration et de lancer des sous-agents parallèles en une seule session, de vérifier leurs sorties et de faire un rapport – tout comme ce que Hermes fait depuis un certain temps maintenant.

Les workflows dynamiques sont disponibles pour les utilisateurs des plans Enterprise, Team et Max, et Anthropic indique clairement qu'ils consomment beaucoup plus de jetons qu'une session Claude Code standard.

L'écart de prix s'élargit

La tarification d'Anthropic de 5 $/25 $ semble très différente de ce que la Chine a fait récemment.

DeepSeek V4 Pro a rendu sa réduction de 75% permanente la semaine dernière : 0,435 $ par million de jetons d'entrée et 0,87 $ par million de jetons de sortie. Xiaomi MiMo V2.5 Pro fonctionne aux mêmes tarifs via des fournisseurs comme OpenRouter.

Le mode rapide d'Anthropic coûte 10 $ en entrée et 50 $ en sortie par million — plus cher que l'Opus 4.8 standard lui-même, et environ 57 fois plus par jeton de sortie que DeepSeek V4 Pro. Les entreprises ont déjà dépensé des millions de dollars en inférence sur les modèles américains. Allez-y à fond avec Opus et votre entreprise pourrait atteindre des millions de dollars assez rapidement.

La réponse d'Anthropic à cet écart de prix est la qualité et la sécurité. Sur SWE-bench Pro, Opus 4.8 surpasse les deux modèles chinois. En matière d'alignement, aucun des deux n'approche les benchmarks publiés par Anthropic.

Ces éléments sont importants dans les environnements de production où un modèle coopérant discrètement avec de mauvaises entrées représente un risque réel — industries réglementées, travail juridique, et tout ce où "ça semblait bien" n'est pas un rapport post-incident acceptable. Pour tous les autres, l'écart est difficile à ignorer.

Nous l'avons testé

Nous avons effectué un test de codage rapide pour créer un jeu de zombies en 3D afin de voir comment Claude Opus 4.8 se compare à ChatGPT et DeepSeek, sans doute ses concurrents les plus populaires des États-Unis et de Chine. Nous avons réglé Opus 4.8 en mode "high" par défaut, GPT-5.5 en mode "high effort" et DeepSeek V4 Pro en mode "high effort" — trois modèles, une seule instruction, pas de réessais.

GPT-5.5 a terminé en premier. Son jeu n'avait pas d'images de zombies ni d'effets sonores. Il était rapide, certes, mais il a complètement manqué le cahier des charges.

DeepSeek V4 Pro est arrivé en deuxième position avec un mouvement de souris, de vrais personnages zombies, des effets sonores, des mécanismes solides et une esthétique épurée. Aucune plainte à formuler.

Opus 4.8 a pris environ trois fois plus de temps que GPT-5.5, mais a livré le meilleur écran de démarrage, les meilleurs designs de zombies, les meilleurs mécanismes de jeu et des effets sonores corrects. Il était le plus lent, mais a fourni la meilleure sortie. Néanmoins, ce n'est probablement pas suffisant pour justifier son utilisation par rapport à DeepSeek, étant donné l'écart de coût.

Tous les jeux sont disponibles sur notre profil Itch.io. GPT-5.5 a généré "Zombie Typing", Opus a généré "Typing Dead", et DeepSeek v4 Pro a généré un jeu sans nom qui vous plonge directement dans l'action. Appelons-le "TypeSeek".

Une analyse comparative complète est à venir. Pour l'instant : Claude Opus 4.8 code mieux que GPT-5.5 et Opus 4.7 pour ce type de tâche, au même prix qu'Anthropic facture depuis la version 4.7. Les développeurs qui payaient déjà 5 $ par million de jetons ont juste obtenu un meilleur modèle gratuitement.