
Claude Opus 5 est disponible aujourd'hui. Il est moins cher à utiliser pour les entreprises que le modèle phare d'Anthropic, Claude Fable 5, que la société avait positionné comme le produit de pointe quotidien pour les utilisateurs payants. De plus, Opus 5 le surpasse également sur d'importants benchmarks.
Pour comprendre la position d'Opus 5 : la gamme d'Anthropic compte quatre niveaux. Haiku est rapide et économique. Sonnet est de milieu de gamme. Opus est le cheval de bataille robuste. Au-dessus se trouve la classe Mythos – un niveau qu'Anthropic a introduit ce printemps – qui comprend Claude Fable 5 pour le public, et Claude Mythos 5, une version avec moins de restrictions réservée via Project Glasswing aux chercheurs en cybersécurité agréés et aux opérateurs d'infrastructures critiques.
Fable 5 a connu un parcours difficile en tant que produit phare pour les abonnés. Lancé le 9 juin, il a été retiré mondialement trois jours plus tard après que le gouvernement américain ait émis une ordonnance de contrôle des exportations d'urgence citant une vulnérabilité de jailbreak, et est revenu le 30 juin – pour passer immédiatement à un modèle basé uniquement sur les crédits, n'étant plus inclus dans les plans standards. Opus 5 occupe désormais la place que Fable 5 n'a pas pu conserver.
Lovable, une plateforme de développement comptant des millions d'utilisateurs, a testé Opus 5 lors de ses évaluations internes et a constaté que les gains s'étendaient au-delà des scores bruts : « Il n'est pas seulement meilleur sur nos tâches de codage agentique les plus difficiles, en hausse de 22 % par rapport à Opus 4.7, il est aussi plus stable, avec beaucoup moins de variance d'une exécution à l'autre », a déclaré Fabian Hedin dans un communiqué partagé par Anthropic.
Cela peut paraître étrange, mais Opus surpasse Fable sur presque tout ce qui compte pour l'utilisateur quotidien, sans pour autant être étiqueté comme étant de la classe Mythos, contrairement à Fable.
Sur Frontier-Bench v0.1 – un benchmark qui teste si les agents de codage IA peuvent accomplir des tâches d'ingénierie logicielle réelles de bout en bout, noté en pourcentage de tâches réussies – Opus 5 a atteint 43,3 %. Fable 5 a obtenu 33,7 %. Le GPT-5.6 Sol d'OpenAI, principal rival commercial d'Anthropic, a obtenu 34,4 %.
La plus grande marge se trouve sur ARC-AGI-3, un test de résolution de problèmes authentique basé sur des énigmes inédites qu'un modèle n'aurait pas pu mémoriser à partir des données d'entraînement, noté en pourcentage d'énigmes résolues. Opus 5 a atteint 30,2 % ; GPT-5.6 Sol a obtenu 7,8 % ; et Fable 5 n'a pas été testé du tout. Sur GDPval-AA v2 – un benchmark de travail intellectuel évalué par des classements Elo, le système de classement de type échecs utilisé pour mesurer la performance relative sur des tâches professionnelles réelles – Opus 5 a atteint 1 861 contre 1 747 pour Fable 5 et 1 736 pour GPT-5.6 Sol.
Zapier a testé Opus 5 sur AutomationBench, une évaluation qui mesure la capacité d'un modèle à exécuter un flux de travail commercial complet du début à la fin sans intervention humaine. Leur verdict : le modèle « a pris un classeur brut de santé de compte et a exécuté une séquence complète de prévention de la désabonnement de bout en bout : signalement des comptes à risque, alerte du bon propriétaire et résumé pour les opérations de rétention. Les modèles précédents n'ont pas réussi ; Opus 5 a atteint 100 % ».
Anthropic présente également Opus 5 comme une amélioration pour la recherche. Ultima Genomics, une entreprise de séquençage d'ADN, a déclaré que le modèle « se comporte davantage comme un scientifique prudent que tout autre modèle que nous avons utilisé. Il choisit les bons tests statistiques pour éliminer les facteurs de confusion, vérifie ses propres résultats par des méthodes indépendantes et reste sur la bonne voie à travers de longues analyses en plusieurs étapes ».
Cela dit, ces deux domaines – juridique et de la santé – sont les seuls où Fable 5 excelle par une infime marge.
Cette sortie intervient une semaine après que Moonshot AI, une startup basée à Pékin et soutenue par Alibaba, a dévoilé Kimi K3 – un modèle open-weight de 2,8 trillions de paramètres (ce qui signifie que n'importe qui peut télécharger le code sous-jacent pour l'exécuter indépendamment) que Moonshot décrit comme le plus grand système d'IA ouvert au monde. Les benchmarks indépendants placent constamment Kimi K3 en troisième position globale, derrière Fable 5 et GPT-5.6 Sol, mais le surpassant dans des domaines spécifiques.
Opus 5 est désormais disponible via API au prix de 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie. (Les tokens sont l'unité d'information de base qu'un modèle d'IA peut traiter en entrée et en sortie). Un mode rapide, fonctionnant environ 2,5 fois plus vite que la vitesse par défaut, est également disponible, à un prix double : 10 $ par million de tokens d'entrée et 50 $ par million de tokens de sortie.
Cette sortie pourrait mettre fin à l'inquiétude concernant le manque de disponibilité publique de Fable 5. Opus est également disponible via abonnement pour tout le monde.