
La plupart des gens connaissent Xiaomi comme la marque de téléphone chinoise. Celle qui fabrique des scooters électriques et des purificateurs d'air bon marché. Pas exactement l'entreprise que l'on s'attendrait à voir battre un record majeur de vitesse d'inférence en IA un lundi matin.
Et pourtant. Xiaomi vient de lancer MiMo-V2.5-Pro-UltraSpeed, un mode de service pour son modèle phare à mille milliards de paramètres qui atteint plus de 1 000 tokens par seconde — culminant à près de 1 200 lors des démonstrations.
Les paramètres sont les poids numériques internes qui définissent la façon dont un modèle « pense » — plus il y en a, plus les motifs qu'il peut reconnaître sont complexes. Les tokens sont les morceaux de texte que le modèle lit et écrit, représentant en moyenne environ les trois quarts d'un mot.
Xiaomi l'a réalisé sur un seul nœud standard à 8 GPU. Matériel standard, pas de puces personnalisées. Cela change le calcul pour savoir qui peut réellement déployer ce genre de vitesse en production.
Pour replacer ce chiffre dans un contexte humain : selon Artificial Analysis, GPT-5.5 — ce à quoi la plupart des utilisateurs de ChatGPT parlent réellement — se situe à 68 tokens par seconde. Claude Opus 4.6 atteint environ 71, et le modèle inférieur, Haiku, frôle les 98 tokens par seconde. Gemini Flash atteint 192 tokens par seconde. MiMo-V2.5-Pro-UltraSpeed fait 1 000, sur un modèle qui égale Opus sur les benchmarks de codage.
Cerebras et Groq ont bâti des entreprises entières autour de ce problème. Cerebras a conçu une puce à l'échelle d'une tranche de silicium, de la taille d'une assiette, intégrant 44 Go de mémoire sur puce pour éliminer le goulot d'étranglement de la bande passante qui ralentit l'inférence GPU. Elle a atteint 969 tokens par seconde sur le modèle Llama 3.1 405B de Meta — impressionnant, mais il s'agit d'un modèle de 405 milliards de paramètres, moins de la moitié de la taille de MiMo-V2.5-Pro. L'architecture de processeur de langage personnalisé de Groq culmine entre 300 et 750 tokens par seconde selon le modèle.
Aucune de ces solutions ne fonctionne sur du matériel que vous pouvez louer chez AWS ce soir.
Xiaomi l'a fait sur des GPU grand public grâce à un logiciel uniquement — une combinaison d'astuces au niveau du modèle et d'un moteur d'inférence conçu sur mesure appelé TileRT.
Deux techniques sont à l'origine de cette vitesse. La première est appelée Quantification FP4 : au lieu d'exécuter le modèle avec une précision numérique complète de 8 ou 16 bits, Xiaomi réduit les couches d'experts — qui constituent la majeure partie des mille milliards de paramètres — à 4 bits. L'encombrement mémoire diminue, la pression sur la bande passante diminue, la vitesse augmente. L'inconvénient habituel est une légère dégradation de la qualité. La solution de Xiaomi est chirurgicale : seules les couches d'experts sont compressées, tout le reste reste à pleine précision. Avec cette approche, la perte de qualité est décrite comme quasi nulle.
La seconde est le décodage spéculatif DFlash. Le décodage spéculatif normal utilise un petit modèle de brouillon pour deviner les quelques tokens suivants, puis le grand modèle les vérifie en parallèle. DFlash saute entièrement le brouillon séquentiel — il remplit un bloc entier de positions masquées en un seul passage avant. Dans les tâches de codage, le grand modèle accepte en moyenne 6,3 tokens sur 8 proposés par cycle de vérification. Cela représente six tokens confirmés en une seule étape au lieu d'un seul.
TileRT assure la cohésion de l'ensemble. Il maintient l'intégralité du pipeline de calcul résidente en continu dans le GPU — pas de surcoût de lancement par opérateur, pas de lacunes d'exécution.
Xiaomi appelle cette approche le « codesign modèle-système extrême », et l'expression est exacte : aucune technique seule n'atteint 1 000 tokens par seconde, mais la synergie entre toutes les approches y parvient.
MiMo-V2.5-Pro est un modèle de pointe. Nous avons couvert le lancement de la version V2.5 Pro en avril — il égale Claude Opus sur la plupart des benchmarks de codage et coûte environ 0,43 $ en entrée / 0,87 $ en sortie par million de tokens. Opus coûte 5 $ en entrée / 25 $ en sortie par million de tokens.
UltraSpeed accélère exactement ce modèle MiMo V2.5 Pro, et non une version allégée.
Une inférence suffisamment rapide change la façon dont on peut utiliser un modèle. Vous pouvez exécuter des dizaines de chemins de raisonnement en parallèle au lieu d'attendre une seule réponse. La détection de fraude, la génération de signaux de trading, les boucles d'agents en temps réel — toutes ces applications ont des contraintes de latence strictes que 60 tokens par seconde ne peuvent pas satisfaire. À 1 000 tokens par seconde, elles le peuvent.
Xiaomi propose la vitesse à 3 fois le tarif standard de MiMo-V2.5-Pro pour environ 10 fois le débit. L'essai API se déroule du 9 au 23 juin, sur candidature, avec une priorité accordée aux développeurs d'entreprise et professionnels. Le checkpoint FP4-DFlash est déjà open-sourcé sur Hugging Face pour les tests communautaires.