Page d'accueilCentre d'actualités LBank
Le Kimi K3 chinois est lancé — et surpasse Claude Fable et GPT 5.6 Sol sur les principaux benchmarks
china-kimi-k3-largest-open-source-ai-model-ever-beats-claude-fable-gpt-5-6-sol
Le Kimi K3 chinois est lancé — et surpasse Claude Fable et GPT 5.6 Sol sur les principaux benchmarks
Le modèle de 2,8 billions de paramètres de Moonshot AI surpasse Fable 5 sur un benchmark d'écriture créative et est en tête du classement de code frontal d'Arena AI — le tout au tarif de Claude Sonnet.
2026-07-17 Source:decrypt.co

En bref

  • Moonshot AI a lancé Kimi K3 le 16 juillet – un modèle à poids ouverts de 2,8 billions de paramètres qui surpasse les laboratoires américains sur des benchmarks spécialisés spécifiques.
  • K3 est tarifé de manière identique à Claude Sonnet 5 (3 $ par million de jetons d'entrée, 15 $ par million de jetons de sortie) tout en se rapprochant des performances de Fable 5.
  • Les poids complets du modèle – les fichiers qui permettent à quiconque d'exécuter, d'affiner ou de développer localement sur le modèle – seront publiés d'ici le 27 juillet sous une licence MIT modifiée, faisant de K3 le plus grand modèle d'IA librement disponible de l'histoire.

Moonshot AI vient de publier le plus grand modèle open-source chinois jamais sorti, et il a surpassé Claude Fable 5 en matière d'écriture de scripts.

Le Writing Elo de Towards AI – un benchmark où les modèles écrivent de véritables scripts jugés à l'aveugle par rapport à des versions publiées, notés en utilisant le même système Elo qui classe les joueurs d'échecs – a placé Kimi K3 à 2 840, au-dessus de Fable 5 (max) à 2 760. C'est un classement que l'équipe d'Anthropic a historiquement dominé.

Grande nouvelle de notre benchmark interne d'écriture (résultats préliminaires) : Kimi K3 de @Kimi_Moonshot est désormais n°1 pour l'écriture dans notre voix éditoriale, avec 2840 Elo, surpassant Claude Fable 5.

C'est un bond de la 21e à la 1re place par rapport à son prédécesseur, Kimi K2.6. Et il coûte environ 0,25 $ par script : 5x… https://t.co/000EosInEc pic.twitter.com/V18t7g4pHu

— Louis-François Bouchard 🎥🤖 (@Whats_AI) July 16, 2026

K3 a également revendiqué la première place sur le classement du code Frontend d'Arena AI – un classement construit à partir de milliers de votes humains par paires sur des tâches de génération de code, également notées Elo – avec 1 679 contre 1 631 pour Fable 5. Première place dans six des sept domaines frontend.

Grande nouvelle : Kimi-K3 de @Kimi_Moonshot est désormais n°1 dans l'arène du code Frontend avec 1679 points, surpassant Claude Fable 5.

C'est un bond de 17 places pour Kimi-k2.6 (n°18 -> n°1).

En Frontend, Kimi-K3 s'est classé n°1 dans 6 des 7 domaines : Marque & Marketing, Conception basée sur la référence, Données & Analyses,… https://t.co/YDN3BufGkC pic.twitter.com/Oa6teaQnWp

— Arena.ai (@arena) July 16, 2026

L'indice d'intelligence d'analyse artificielle – un score construit à partir de neuf évaluations indépendantes couvrant le codage, le raisonnement, le travail d'agent et les connaissances, noté de 0 à 100 – place K3 à 57, avec Claude Fable 5 à 60, GPT-5.6 Sol à 59 et Claude Opus 4.8 à 56. Cela place K3 comme le troisième modèle le plus performant sur l'indice composite, Fable 5 le battant de seulement 3 %.

Kimi K3 bat Fable 5 en tête-à-tête sur BridgeBench.

Même tâche, jury aveugle.

K3 a remporté 7 des 8 arènes, y compris Refactoring 9-0 et Debugging 6-1.

La seule victoire de Fable 5 : la vitesse.

Fable 5 a battu GPT 5.6 Sol 142-36 et perd maintenant 2 contre 1 face à un modèle open source… pic.twitter.com/CaRSjbIwUW

— Bridgebench (@bridgebench) July 17, 2026

Kimi K3 est le modèle le plus performant sur https://t.co/SnZ54Xok7n, devant Fable, atteignant un taux de succès comparable en moins de temps.

C'est la première fois qu'un modèle ouvert devance tous les modèles propriétaires pour ce benchmark complet d'ingénierie web.

Notes :

▪️ Benchmarks… pic.twitter.com/2MqvbAxAaw

— Guillermo Rauch (@rauchg) July 16, 2026

Si vous voulez avoir une idée de ce qu'il peut faire, voici un résultat "zero-shot" d'une invite demandant au modèle de construire un clone iOS. À titre de comparaison, c'est la meilleure approximation partagée sur les médias sociaux utilisant GPT 5.6 Sol et une invite beaucoup plus élaborée.

Qu'est-ce que c'est exactement ?

K3 intègre 2,8 billions de paramètres – les valeurs numériques qui stockent les connaissances d'un modèle – dans une architecture de mélange d'experts (MoE). Le mélange d'experts divise ces paramètres en 896 sous-réseaux "experts" et n'active qu'une fraction pour une tâche donnée. C'est ainsi que l'on obtient une intelligence de pointe sans faire fondre la salle des serveurs.

« C'est le premier modèle open-source au monde de la classe des 3 billions de paramètres, conçu pour des scénarios d'intelligence de pointe incluant le codage à long terme, le travail de connaissance et le raisonnement », déclare Moonshot AI. Ce n'est pas du marketing : DeepSeek V4-Pro culmine à 1,6 billion de paramètres, et le propre K2 de Moonshot à un billion. K3 double approximativement son concurrent à poids ouverts le plus proche en termes de taille.

Une capture d'écran montrant les résultats d'un benchmark comparant différents modèles d'IA.

Il est livré avec une fenêtre de contexte d'un million de jetons – les jetons étant l'unité d'information de base traitée par une IA, environ trois quarts de mot chacun – une compréhension native de l'image et de la vidéo, et un raisonnement continu.

Deux techniques architecturales sont à la base des gains d'efficacité. Kimi Delta Attention accélère le décodage pour les séquences longues – jusqu'à 6,3 fois plus rapidement pour les contextes d'un million de jetons. Attention Residuals achemine l'information sélectivement à travers les couches du modèle plutôt que de l'accumuler uniformément, ajoutant environ 25 % d'efficacité d'entraînement pour moins de 2 % de coût de calcul supplémentaire – ce qui se traduit ensemble par une efficacité de mise à l'échelle environ 2,5 fois supérieure à celle de K2.

Les benchmarks sont bien, les prix sont mieux

Kimi K3 coûte 3 $ par million de jetons d'entrée et 15 $ par million de jetons de sortie – le même tarif que Claude Sonnet 5, le modèle de milieu de gamme d'Anthropic. La différence est que Sonnet 5 est l'offre intermédiaire d'Anthropic ; K3 se situe trois points en dessous de Fable 5 sur l'indice composite d'Artificial Analysis. Par tâche, sur cette suite de neuf benchmarks, K3 coûte 0,94 $ contre 1,04 $ pour GPT-5.6 Sol et 1,80 $ pour Opus 4.8.

En d'autres termes, ce modèle offre des performances de pointe à des prix de milieu de gamme.

Comme Decrypt l'a rapporté en mai, l'écart de prix entre l'IA de pointe chinoise et américaine était de 15 à 30 fois plus tôt cette année. K3 ne propose pas des prix aussi bas que DeepSeek – il se positionne comme un modèle occidental de milieu de gamme – mais offre des performances quasi-frontalières à ce niveau. Pour les équipes qui développent sur l'API, cela représente une amélioration majeure des coûts.

Si Anthropic concrétise son intention de rendre Fable 5 disponible uniquement via API, K3 deviendra l'alternative à poids ouverts la plus proche de tout modèle actuellement classé deuxième dans l'industrie – à la moitié du coût par tâche d'Opus 4.8. C'est le scénario que les adeptes des benchmarks sont déjà en train de calculer.

Le lancement de K3 est l'argument que les défenseurs des contrôles d'exportation américains ne veulent pas avoir. Les États-Unis ont restreint l'exportation des GPU H800 de Nvidia vers la Chine fin 2023 ; Moonshot a confirmé avoir entraîné des modèles antérieurs sur ces puces. La documentation de benchmark de K3 elle-même fait référence aux H200 et à ce que la société appelle "un GPGPU d'un fournisseur alternatif" – largement interprété comme du matériel Huawei Ascend – sans préciser où ce matériel est situé.

Yutong Zhang, président de Moonshot AI, a directement abordé cette contrainte à Davos cette année, selon Silicon Republic : "Nous savions que nous n'avions pas le luxe de simplement augmenter la puissance de calcul… Cela nous a forcés à nous concentrer sur la recherche fondamentale et l'efficacité." Les analystes de Bank of America, dans une note après le lancement, ont écrit que K3 prouve que "la mise à l'échelle du pré-entraînement, associée à l'innovation architecturale, peut toujours apporter des gains significatifs pour les modèles chinois phares" malgré ces contraintes.

Moonshot est l'une de ces startups dites "tigres de l'IA" qui ont collectivement transformé le paysage mondial des modèles sans accès aux puces dont Washington disait qu'elles auraient besoin. La question de savoir si cela est un argument en faveur de contrôles d'exportation plus stricts ou un argument selon lequel ils ne fonctionnent pas est une question politique que Washington n'a pas encore tranchée.

L'astérisque que vous devriez lire

Le taux d'hallucination de K3 sur AA-Omniscience – un benchmark qui mesure la fréquence à laquelle un modèle fabrique avec assurance une réponse qu'il ne connaît pas – a bondi de 39 % à 51 % par rapport à son prédécesseur K2.6. Plus de bonnes réponses dans l'ensemble ; plus de réponses inventées aussi. Le modèle reconnaît également dans sa propre documentation qu'il peut être "excessivement proactif", prenant des décisions inattendues au nom de l'utilisateur lors de tâches autonomes longues.

Pour les équipes qui utilisaient les outils basés sur Kimi K2.6 et souhaitent les mettre à niveau, K3 représente une avancée significative sur la plupart des fronts – mais cette différence d'hallucination mérite d'être testée en profondeur avant de lui faire confiance pour quoi que ce soit qui nécessite une précision.

Si vous voulez l'essayer gratuitement, c'est possible. Il est disponible sur le site officiel de Kimi. Mais bonne chance : les serveurs sont tellement saturés que les tâches sont constamment interrompues en raison des contraintes de trafic, ce qui le rend à peine utilisable. Une meilleure alternative est de souscrire un abonnement ou de l'utiliser via une API.

Une autre capture d'écran montrant une interface utilisateur ou des données liées à l'IA.

Les poids seront publiés le 27 juillet. Ils seront disponibles pour les grandes entreprises et les sociétés. Aucune GPU domestique, aussi grande soit-elle, n'est actuellement capable de gérer un modèle de cette taille.