
Perplexity a transformé un modèle open-source chinois en une bête de somme quasi-frontière pour environ un tiers du coût de Claude Opus 4.8.
La société a publié aujourd'hui un aperçu de recherche d'une version post-entraînée du GLM 5.2 de Z.AI, spécialement conçue pour fonctionner au sein de son système d'agent Computer et désormais disponible en production.
We're releasing a research preview of a new orchestrator model in Perplexity Computer.
The model is an adapted version of GLM 5.2, post-trained for the Computer harness. It delivers near-frontier performance at 0.344x of the cost of Opus. pic.twitter.com/jcxikoFRfn
— Perplexity (@perplexity_ai) July 9, 2026
GLM 5.2 est un modèle d'environ 744 milliards de paramètres de Z.ai — anciennement Zhipu AI, un laboratoire de Pékin qui figure sur la liste des entités des États-Unis depuis janvier 2025. (Les paramètres sont tous les différents réglages et configurations qu'un modèle peut gérer pendant l'entraînement. Plus il y a de paramètres, plus un modèle est complexe et puissant.) Publié sous licence MIT en juin, il figure parmi les meilleurs modèles d'IA actuellement disponibles sur les benchmarks de codage à long terme, pour une fraction du coût d'API.
Les poids ouverts signifient que n'importe qui peut le télécharger, le modifier et l'affiner commercialement sans restrictions. Perplexity a fait exactement cela.
Le fine-tuning est le processus qui consiste à prendre un modèle d'IA déjà entraîné et à le réentraîner sur un ensemble de données plus petit et plus ciblé pour l'améliorer dans une tâche spécifique.
Imaginez cela comme le réglage d'une voiture. Différents mécaniciens peuvent avoir la même Honda Civic, par exemple, et la rendre plus rapide pour une course d'accélération, plus esthétique, l'adapter pour un rallye, etc. En IA, les développeurs obtiennent un modèle de base et ajoutent différents paramètres afin que le modèle affiné acquière plus de connaissances dans un domaine spécifique, une orientation politique différente, plus ou moins de restrictions, etc.
Perplexity a utilisé le post-entraînement — un processus similaire appliqué après l'exécution principale de l'entraînement du modèle — pour enseigner au GLM 5.2 une compétence essentielle : savoir quand gérer une tâche lui-même et quand l'escalader vers quelque chose de plus puissant.
Cette escalade est le cœur de ce qu'ils ont construit. Le GLM 5.2 affiné inclut ce que Perplexity appelle un "outil conseiller" — une capacité native à reconnaître quand une requête dépasse sa propre compétence et à la transmettre à un modèle de pointe tiers. La plupart des tâches n'atteignent jamais le modèle coûteux. Seules celles qui en ont réellement besoin le font.
Cela permet d'économiser beaucoup d'argent en inférence.
"Lorsqu'il est associé à un conseiller, ce modèle fonctionne avec des performances de grade Opus 4.8 pour une fraction du coût", a écrit le PDG Aravind Srinivas sur X.
We’ve been post-training a version of GLM that is trained to escalate to a frontier model inside the Computer harness. When paired with an advisor, this model functions at Opus 4.8 grade performance at a fraction of the cost. Available now as a research preview! https://t.co/7y8CjOWOtI
— Aravind Srinivas (@AravSrinivas) July 9, 2026
Perplexity a comparé le système au GLM 5.2 normal pour établir une base de référence des coûts. En utilisant la métrique d'efficacité interne de l'entreprise, qui mesure le coût d'achèvement de tâches complexes, les résultats ont montré que le modèle affiné avec un conseiller est environ deux fois plus cher à exécuter que la version de base. Cependant, l'utilisation du modèle Opus 4.8 de premier niveau pour toutes les tâches est beaucoup plus coûteuse (environ 600 % plus chère).
En combinant ces outils, le système de Perplexity atteint la même qualité de performance qu'Opus, mais pour environ un tiers du prix.
La course à l'IA entre les États-Unis et la Chine est souvent présentée comme un jeu à somme nulle. En pratique, les modèles open-source ne s'arrêtent pas aux frontières. La licence MIT du GLM 5.2 simplifie le calcul : il n'y a pas de contrat d'API à violer, pas d'interrupteur d'accès qu'un gouvernement puisse désactiver. Vous téléchargez les poids et vous pouvez les affiner pour en faire ce que vous voulez.
Perplexity a déjà emprunté cette voie. Lorsque DeepSeek R1 a déferlé sur le monde de l'IA début 2025, la société l'a affiné en R1-1776 — cartographiant environ 300 sujets que l'original refusait d'aborder en raison de la censure du gouvernement chinois, et réentraînant le modèle pour le rendre plus biaisé en faveur des États-Unis. C'est devenu une version hébergée à l'Ouest du même moteur de raisonnement.
"Nous ne sommes pas en mesure d'utiliser les puissantes capacités de raisonnement de R1 sans d'abord atténuer ses biais et sa censure", a écrit l'équipe de Perplexity à l'époque dans un article de blog.
Ainsi, cette initiative avec GLM 5.2 suit le même modèle, à la différence que l'objectif cette fois n'est pas politique mais économique. Le produit Computer de Perplexity orchestre déjà plus de 19 modèles d'IA ; le GLM affiné est conçu pour être le modèle par défaut économique qui absorbe la majeure partie des tâches avant même de toucher un modèle de pointe.
Srinivas a déclaré que la thèse à long terme est simple : post-entraîner des modèles open-source pour qu'ils soient bons en escalade, au sein d'un système d'agent qui sert déjà des millions d'utilisateurs. Perplexity est "positionné de manière unique" pour le résoudre, a-t-il écrit, car l'infrastructure est déjà déployée à grande échelle.
Le modèle fonctionne sur des GPU Nvidia B200 aux États-Unis. Prochaine étape : un post-entraînement de Nemotron 3 Ultra, qui répliquerait la même architecture en utilisant un modèle open-source américain.
Les benchmarks complets et un document de recherche sont attendus dans les semaines à venir. Le modèle est disponible en avant-première de recherche.