
Z.ai a lancé GLM-5.2 le 16 juin, promettant des performances de haut niveau, surpassant son déjà avancé GLM 5.1.
Le laboratoire basé à Pékin, qui figure sur la liste des entités américaines depuis janvier 2025, semble bénéficier des inquiétudes croissantes concernant l'approche américaine de l'IA. Au cours de la semaine dernière, l'interdiction d'Anthropic Fable et le lancement de ce nouveau modèle ont contribué à faire grimper l'action de zAI de 90 %, l'envoyant vers un nouveau sommet historique.
GLM 5.2 a les chiffres pour justifier l'engouement.
Sur FrontierSWE — un benchmark qui évalue si un agent IA peut réaliser des projets techniques ouverts mesurés en heures, couvrant l'optimisation de systèmes, la construction de code à grande échelle et la recherche en ML appliquée, noté par taux de dominance — GLM-5.2 a atteint 74,4 contre 75,1 pour Claude Opus 4.8. Il a surpassé GPT-5.5 à 72,6. Sur SWE-bench Pro, qui teste la résolution autonome de problèmes GitHub du monde réel notée en taux de réussite, GLM-5.2 a obtenu 62,1 contre 58,6 pour GPT-5.5 — et a largement dépassé son prédécesseur GLM-5.1 avec 58,4.
Ce bond qualitatif en fait le meilleur modèle open-source à ce jour dans l'Artificial Analysis Intelligence Index, qui agrège les résultats de 9 scores différents pour évaluer la qualité générale d'un modèle d'IA. Les benchmarks d'OpenRouter le placent dans la même catégorie que le désormais interdit Claude Fable 5.
Le matériel utilisé pour réaliser cet exploit est un autre aspect intéressant de l'histoire. GLM-5.2 a été entraîné sur des puces Huawei Ascend — sans aucun matériel Nvidia dans le pipeline. Emad Mostaque, fondateur de Stability AI, a estimé les coûts d'entraînement totaux à environ 25 millions de dollars, dont 80 % en post-entraînement, ce qui le rendrait extrêmement bon marché par rapport à ses concurrents.
Comme Decrypt l'a rapporté plus tôt cette année, Z.ai entraînait déjà des modèles d'image sur les serveurs Ascend Atlas de Huawei sans aucune puce américaine. GLM-5.2 pousse cette infrastructure plus loin — un modèle "mixture-of-experts" de 744 milliards de paramètres avec une véritable fenêtre contextuelle d'un million de tokens, cinq fois la limite de 200K de GLM-5.1, et une licence MIT qui signifie qu'aucune directive gouvernementale ne peut couper l'accès.
Les tokens sont les morceaux de texte qu'un modèle peut lire et générer, tandis que les paramètres sont le nombre de réglages et de valeurs internes qui déterminent la manière dont un modèle traite l'information et génère des réponses.
Pour les développeurs, la fenêtre contextuelle est le changement opérationnel. La navigation dans des répertoires entiers, les refactorisations multifichiers et les longs pipelines d'agents qui nécessitaient auparavant un découpage deviennent des flux de travail à appel unique. La tarification de l'API est de 1,40 $ par million de tokens d'entrée et de 4,40 $ par million de tokens de sortie — contre 5 $ d'entrée et 25 $ de sortie pour Claude Opus 4.8. Le Coding Plan débute à environ 18 $ par mois et fonctionne directement dans Claude Code, Cline, Kilo Code et la plupart des environnements d'agents populaires.
Le déploiement local est également techniquement possible. Unsloth AI a publié des quantifications GGUF 2 bits qui compressent le modèle de 1,51 To à 238 Go tout en conservant ~82 % de précision.
Ne vous emballez pas trop, cependant. Cela signifie toujours qu'il exige 256 Go de mémoire unifiée ou une combinaison RAM/VRAM équivalente — un Mac Studio M4 Ultra au maximum ou une station de travail avec un GPU de milieu de gamme et 256 Go de RAM système avec un déchargement "mixture-of-experts". C'est encore beaucoup d'argent, mais au moins quelque chose que vous pouvez acheter et exécuter chez vous si vous le souhaitez vraiment.
Nous avons effectué un test rapide, demandant à GLM-5.2 de construire notre jeu standard mélangeant des mécaniques de dactylographie avec un jeu de tir. L'interface utilisateur n'était pas la plus jolie — d'autres modèles ont généré des interfaces plus polies, mais l'expérience était la plus variée : différents scénarios à travers les vagues, des types d'ennemis qui changeaient, des boss apparaissant plus tard dans la partie.
Il a généré des états de jeu plus diversifiés que tout ce que nous avons testé pour la même tâche en "zero-shot".
Si vous voulez y jouer, il est disponible sur notre profil Itch.io.
Cette variance indique où GLM-5.2 est le plus judicieux économiquement. Pour les flux de travail de génération multi-shot et les pipelines d'agents où la diversité de la sortie importe plus que le polissage, le calcul au niveau des prix open-source est difficile à contester. Pour les tâches soutenues les plus difficiles — SWE-Marathon, où il obtient 13,0 contre 26,0 pour Opus 4.8 — l'écart avec la frontière fermée est toujours réel, et de 13 points.
Les poids open-source sont disponibles sur HuggingFace sous licence MIT. Les poids quantifiés sont également disponibles sur HuggingFace. Les abonnés au GLM Coding Plan peuvent désormais basculer avec la chaîne de modèle GLM-5.2, et il est également disponible pour des tests gratuits sur z.AI avec certaines contraintes d'utilisation.