
Les modèles d'IA consomment beaucoup de mémoire. Un modèle d'IA de 27 milliards de paramètres, considéré comme de taille moyenne selon les standards de l'industrie, nécessite environ 54 Go de mémoire pour fonctionner en demi-précision. La plupart des ordinateurs portables ne peuvent pas gérer cela. Certains postes de travail non plus.
Plus tôt cette semaine, PrismML en a lancé un de 3,9 Go – suffisamment petit pour tenir sur un iPhone.
Les paramètres sont le nombre de réglages et d'ajustements qu'un modèle peut gérer. Plus il y a de paramètres, plus un modèle est dense et capable.
Bonsai 27B est le premier modèle de la classe 27B à franchir le plafond de mémoire d'un smartphone grand public, fonctionnant à 11 jetons par seconde sur un iPhone 17 Pro Max. (Les jetons sont l'unité d'information de base que les modèles d'IA peuvent gérer et produire.) La variante ternaire, à 5,9 Go, atteint environ 26 jetons par seconde sur un ordinateur portable M5 Pro. Les deux sont disponibles gratuitement sous licence Apache 2.0.
La méthode de compression, basée sur la propriété intellectuelle de Caltech, réduit chaque poids de modèle de 16 bits de précision en virgule flottante à un seul signe – +1 ou -1 dans la version binaire, l'une des trois valeurs dans le ternaire. Chaque groupe de 128 poids partage un facteur d'échelle de 16 bits, ce qui ramène la variante binaire à 1,125 bits par poids : 14 fois plus petite que l'original en pleine précision. Le modèle ternaire ajoute un état zéro pour une puissance expressive légèrement accrue et s'établit à 1,71 bits.
En termes plus simples, cela signifie qu'un modèle d'IA ternaire utilise seulement trois réglages pour chaque valeur interne – négatif, zéro ou positif – tandis qu'une IA standard peut choisir parmi environ 65 000 réglages.
PrismML a réalisé cela sans perdre beaucoup de la qualité de sortie.
Ce qui distingue cette approche des modèles « low-bit » conventionnels, c'est qu'aucun élément ne bénéficie d'une échappatoire de plus haute précision : les embeddings, l'attention et la tête complète du modèle de langage sont tous compressés de bout en bout. La plupart des versions quantifiées conservent certaines couches sensibles en pleine précision, ce qui finit par augmenter leur taille en échange d'une meilleure qualité. Bonsai ne suit pas cette approche.
C'est la deuxième version majeure de la famille. En mars, PrismML a livré Bonsai 8B, un modèle de 1,15 Go qui a prouvé que l'architecture 1 bit pouvait survivre avec 8 milliards de paramètres sans que son raisonnement ne s'effondre. Le saut à 27 milliards est là où les enjeux changent – c'est à cette échelle que le raisonnement en chaîne de pensée soutenu, l'utilisation fiable d'outils et le comportement agentique en plusieurs étapes émergent de manière cohérente – des choses que les modèles plus petits peinent encore à faire.
Sur 15 benchmarks évalués en mode de réflexion sur des GPU NVIDIA H100 – couvrant la connaissance, les mathématiques, le codage et l'utilisation d'outils – Ternary Bonsai 27B obtient une moyenne de 80,49, soit 94,6 % du modèle en pleine précision. La variante 1 bit atteint 76,11.
Globalement, sur les benchmarks, les modèles sont bien plus performants que Gemma 4 ou Qwen 3.6 en termes de potentiel qu'ils offrent pour leur taille.
Les modèles sont plutôt bons pour ce qu'ils offrent, et étant donné le peu de ressources qu'ils nécessitent, ils élèvent les petits matériels (smartphones et PC bas de gamme) à un autre niveau en termes de capacités. Les AIME25 et AIME26, basés sur l'examen américain de mathématiques par invitation, affichent 93,7% pour Ternary Bonsai 27B contre 95,3% pour le bien plus grand Qwen 3.6B. Bonsai obtient 86 points en codage contre 88 pour Qwen 3.6 et 77% en connaissances générales contre 83 pour Qwen 3.6.
Le modèle utilise également une architecture d'attention hybride où environ 75 % des couches sont linéaires plutôt qu'une attention quadratique complète. Cette architecture rend une fenêtre de contexte de 262K jetons pratique sur l'appareil – ce qu'une pile d'attention standard rendrait prohibitivement coûteux sur le matériel d'un téléphone.
Nous avons nous-mêmes exécuté Bonsai 27B. Le codage demande des itérations : les prompts en un seul coup ne rivaliseront pas avec les modèles frontaliers du cloud. Le fait qu'il soit local et gratuit rend cela sans importance. Pour notre jeu Zombie Type – un jeu de navigateur d'horreur de frappe à la première personne – deux séries de codage « vibe » ont produit une détection de collision propre, une logique de score appropriée et des graphiques cohérents. Le modèle saisit la structure tôt ; la deuxième passe affine plutôt que de reconstruire.
Il est intéressant de noter que certains modèles (comme les squelettes) semblaient plus élaborés que ceux de GPT 5.6 Sol. Cela ne signifie en aucun cas qu'il est meilleur, juste que sur cette tâche, il a produit un squelette mignon tandis que le roi de l'IA a fait un choix stylistique moins bon.
Le jeu est disponible pour test ici.
L'écriture créative est une histoire plus nuancée, et les critères sont plus subjectifs.
En gros, les résultats ne sont pas particulièrement imaginatifs si vous avez un prompt "zero-shot" en tête.
Cela dit, Bonsai produit des histoires avec une logique interne, un rythme et un arc narratif cohérents – meilleurs, ou à égalité avec Claude Haiku ou même Sonnet avec moins d'effort sur des prompts comparables. Pour un modèle qui fonctionne entièrement sur votre propre matériel sans frais d'API, c'est beaucoup dire.
L'histoire qu'il a créée peut être trouvée dans notre dépôt Github.
PrismML propose également une couche de décodage spéculatif DSpark avec le modèle – un brouilleur léger qui propose des blocs de jetons candidats, que le modèle principal vérifie en une seule passe avant au lieu de générer jeton par jeton. Sur un H100, cela ajoute une augmentation du débit de 1,37x sans changement de la qualité de sortie, car la vérification préserve la distribution de sortie exacte. Sur Apple Silicon, ce n'est pas encore activé par défaut, mais pour les serveurs GPU, c'est un réel gain.
L'intérêt d'Apple ajoute une dimension commerciale. Le PDG de PrismML, Babak Hassibi, a confirmé à CNBC que l'entreprise est en discussions préliminaires avec Apple, qui évalue la technologie de compression pour une utilisation potentielle sur l'appareil.
Hassibi a déclaré qu'un modèle Gemma compressé est la prochaine étape dans le pipeline, suivi de modèles frontaliers plus grands ; Bonsai 27B 1 bit est disponible en téléchargement gratuit dès maintenant sous licence Apache 2.0. Si vous avez besoin d'un guide pour exécuter des modèles comme celui-ci localement, consultez notre tutoriel.