Page d'accueilCentre d'actualités LBank
Le nouveau Grok 4.5 est disponible. Elon Musk affirme qu'il rivalise avec le Claude Opus de l'année dernière.
grok-4-5-elon-musk-claude-opus
Le nouveau Grok 4.5 est disponible. Elon Musk affirme qu'il rivalise avec le Claude Opus de l'année dernière.
Le nouveau modèle de codage de SpaceXAI est moins cher et plus rapide que les modèles phares d'Anthropic et d'OpenAI — et de l'aveu même de Musk, il a au moins une génération de retard sur eux.
2026-07-08 Source:decrypt.co

En bref

  • SpaceXAI a lancé Grok 4.5 le 8 juillet à 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie, soit moins de la moitié du prix des modèles comparables d'Anthropic et d'OpenAI.
  • Elon Musk a posté sur X que le modèle est "à peu près comparable à Opus 4.7", l'ancien modèle phare d'Anthropic, désormais remplacé par Opus 4.8, tout en vantant la vitesse et le coût par rapport aux performances de référence.
  • Grok 4.5 n'est pas encore disponible dans l'UE ; SpaceXAI indique qu'un accès européen est prévu pour la mi-juillet.

SpaceXAI d'Elon Musk a lancé Grok 4.5 mercredi, son premier modèle public depuis la finalisation de la fusion SpaceX-xAI en février et l'accord de 60 milliards de dollars de SpaceX pour acquérir Cursor. Il cible les codeurs, les ingénieurs et ce que l'entreprise appelle les "travailleurs du savoir"—une catégorie qui semble couvrir tout le monde, des développeurs de logiciels aux avocats révisant des contrats, en passant par les équipes financières construisant des modèles Excel.

L'argument de l'entreprise n'est pas qu'il s'agit du meilleur modèle. C'est qu'il est bon marché, du moins pour un modèle occidental. Grok 4.5 coûte 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie. Claude Opus 4.8, le principal modèle phare d'Anthropic, coûte 5 $ en entrée et 25 $ en sortie. GPT 5.6 Sol, le nouveau modèle haut de gamme d'OpenAI, également lancé mercredi, est tarifé à 5 $ en entrée et 30 $ en sortie.

Musk a posté sur X et a clarifié la position réelle de son nouveau modèle. Il l'a qualifié de "à peu près comparable à Opus 4.7, mais beaucoup plus rapide". Opus 4.7 est l'ancien modèle phare d'Anthropic ; Opus 4.8 l'a depuis remplacé. Claude Fable 5 est désormais l'offre haut de gamme d'Anthropic.

Il a présenté cela comme un compromis délibéré : la vitesse et le coût l'emportant sur la capacité brute, avec les ingénieurs de Tesla et SpaceX comme preuve de son utilité dans le monde réel.

Ce que les benchmarks révèlent réellement

SpaceXAI a publié quatre résultats de benchmark lors du lancement, et le tableau est mitigé. DeepSWE 1.1 mesure la fiabilité avec laquelle une IA peut corriger de vrais bugs logiciels soumis par des développeurs, en utilisant une configuration de test standardisée pour que les modèles puissent être comparés équitablement, notés en pourcentage de problèmes résolus. Grok 4.5 a obtenu 53 %, derrière Claude Opus 4.8 (59 %) et GPT 5.5 (67 %). Claude Fable 5, le modèle de pointe d'Anthropic, a dominé le classement avec 70 %.

Sur SWE Bench Pro, un autre benchmark qui mesure une collection de problèmes d'ingénierie logicielle notés par le taux de résolution, Grok 4.5 a affiché 64,7 %, suffisant pour battre les 58,6 % de GPT 5.5 sur ce test particulier. Opus 4.8 est toujours en tête avec 69,2 %, et Fable 5 se situe à 80,4 %.

Les benchmarks de l'entreprise comparent Grok à GPT 5.5, et non à GPT 5.6, car ce dernier a également été lancé mercredi, quelques heures après l'annonce de Grok 4.5.

SpaceXAI a entraîné Grok 4.5 en collaboration avec Cursor AI, récemment acquise, sur des dizaines de milliers de GPU Nvidia GB300 au sein de Colossus, le superordinateur de Memphis doté d'une capacité totale de plus de 200 000 GPU. Les laboratoires dont les modèles le surpassent sur ces mêmes benchmarks ne possèdent rien de comparable en termes de matériel. Le modèle qui en résulte est compétitif, mais pas le premier.

Ce schéma a suivi Grok à travers plusieurs versions. SpaceXAI a constamment affiché une puissance de calcul énorme et des scores en troisième position. Ce qui a changé avec Grok 4.5, c'est la tarification et le signal d'entraînement.

Où son argumentaire tient la route

Le meilleur argument n'est pas la performance brute ; c'est l'efficacité mathématique. Sur les tâches SWE Bench Pro, Grok 4.5 a utilisé en moyenne 15 954 jetons de sortie pour accomplir chaque tâche. Opus 4.8 a consommé 67 020 jetons pour le même travail, soit un écart de 4,2 fois.

Pour les équipes utilisant l'IA à grande échelle, cette différence se traduit par des économies réelles en plus du prix par jeton déjà plus bas. Même avec Grok 4.5 obtenant des scores si bas dans les benchmarks de qualité, des jetons moins chers et une plus grande efficacité d'utilisation permettent davantage d'itérations sans dépenser autant.

Le modèle fonctionne également à 80 jetons par seconde, ce qui le place dans la catégorie des modèles rapides. Grok 4.5 a été entraîné sur des données de sessions de développeurs provenant de Cursor, incluant des traces de débogage et de réelles modifications de code plutôt que des dépôts statiques. Comme Musk l'a admis devant le tribunal, les pratiques d'entraînement de xAI ont déjà fait l'objet d'un examen minutieux ; cette fois, le pipeline passe par une plateforme que SpaceX est en train d'acquérir purement et simplement.

Pour les développeurs exécutant des tâches de codage à grand volume, le calcul fonctionne : une capacité équivalente à peu près à Opus 4.7 avec 60 % de moins par jeton d'entrée. Pour quiconque recherche la pointe, Claude Fable 5 est en tête dans toutes les catégories que SpaceXAI a choisi de publier. Notre test rapide utilisant Grok build sur Hermes a été décevant pour l'écriture créative et acceptable pour une tâche de codage simple.

Le modèle est disponible via API, sur Hermes et Grok build avec un demi-million de jetons de contexte (un peu moins de 400 000 mots). Les utilisateurs européens devront attendre avant de l'utiliser ; SpaceXAI indique que Grok 4.5 arrivera dans l'UE à la mi-juillet.