
Los modelos de IA consumen mucha memoria. Un modelo de IA de 27 mil millones de parámetros, considerado de tamaño mediano según los estándares de la industria, necesita aproximadamente 54 GB de memoria para ejecutarse en media precisión. La mayoría de las computadoras portátiles no pueden soportar eso. Algunas computadoras de escritorio tampoco.
A principios de esta semana, PrismML lanzó uno de 3.9 GB, lo suficientemente pequeño como para caber en un iPhone.
Los parámetros son el número de ajustes y modificaciones que un modelo puede manejar. Cuantos más parámetros, más denso y capaz es un modelo.
Bonsai 27B es el primer modelo de la clase 27B en superar el límite de memoria de un smartphone de consumo, ejecutándose a 11 tokens por segundo en un iPhone 17 Pro Max. (Los tokens son la unidad básica de información que los modelos de IA pueden manejar y producir.) La variante ternaria, de 5.9 GB, alcanza aproximadamente 26 tokens por segundo en una laptop M5 Pro. Ambos son gratuitos bajo la licencia Apache 2.0.
El método de compresión, basado en propiedad intelectual de Caltech, reduce cada peso del modelo de 16 bits de precisión de punto flotante a un solo signo —+1 o -1 en la construcción binaria, uno de tres valores en la ternaria. Cada grupo de 128 pesos comparte un factor de escala de 16 bits, lo que sitúa la variante binaria en 1.125 bits por peso: 14 veces más pequeña que la original de precisión completa. El modelo ternario añade un estado de cero para una potencia expresiva ligeramente mayor y se establece en 1.71 bits.
En términos más sencillos, esto significa que un modelo de IA ternario utiliza solo tres configuraciones para cada valor interno —negativo, cero o positivo— mientras que una IA estándar puede elegir entre aproximadamente 65,000 configuraciones.
PrismML logró esto sin perder gran parte de la calidad de la salida.
Lo que diferencia a esto de los modelos convencionales "de baja resolución" es que nada obtiene una vía de escape de mayor precisión: las incrustaciones (embeddings), la atención y el cabezal completo del modelo de lenguaje están todos comprimidos de extremo a extremo. La mayoría de las construcciones cuantificadas mantienen ciertas capas sensibles a plena precisión, lo que termina aumentando su tamaño como una compensación por una mejor calidad. Bonsai no juega a eso.
Esta es la segunda versión importante de la familia. En marzo, PrismML lanzó Bonsai 8B, un modelo de 1.15 GB que demostró que la arquitectura de 1 bit podía sobrevivir con 8 mil millones de parámetros sin que su razonamiento colapsara. El salto a 27 mil millones es donde cambian las apuestas —esa escala es donde el razonamiento sostenido de cadena de pensamiento, el uso confiable de herramientas y el comportamiento agéntico de múltiples pasos realmente emergen de manera consistente— cosas en las que los modelos más pequeños aún tropiezan.
En 15 puntos de referencia evaluados en modo de pensamiento en GPUs NVIDIA H100 —que abarcan conocimiento, matemáticas, codificación y uso de herramientas— el Bonsai 27B ternario promedia 80.49, o el 94.6% del modelo de precisión completa. La variante de 1 bit alcanza 76.11.
En general, en las evaluaciones de rendimiento, los modelos rinden mucho mejor que Gemma 4 o Qwen 3.6 en cuanto al potencial que ofrecen para su tamaño.
Los modelos son bastante buenos para lo que ofrecen, y considerando los pocos recursos que requieren, llevan el hardware pequeño (smartphones y PCs de gama baja) a otro nivel en términos de capacidades. AIME25 y AIME26, modelados a partir del American Invitational Mathematics Examination, dan 93.7% para el Bonsai 27B ternario frente al 95.3% para el mucho más grande Qwen 3.6B. Bonsai obtiene 86 puntos en codificación frente a 88 para Qwen 3.6 y 77% en conocimientos generales frente a 83 para Qwen 3.6.
El modelo también utiliza una arquitectura de atención híbrida donde aproximadamente el 75% de las capas son lineales en lugar de atención cuadrática completa. Esa arquitectura es lo que hace que una ventana de contexto de 262K tokens sea práctica en el dispositivo, algo que una pila de atención estándar haría prohibitivamente costoso en el hardware de un teléfono.
Ejecutamos Bonsai 27B nosotros mismos. La codificación requiere iteración: los prompts de una sola vez no competirán con los modelos de frontera en la nube. Al ser local y gratuito, eso es irrelevante. Para nuestro juego Zombie Type —un juego de terror de mecanografía en primera persona para navegador— dos rondas de codificación de ambiente produjeron una detección de colisiones limpia, una lógica de puntuación adecuada y gráficos coherentes. El modelo capta la estructura temprano; la segunda pasada refina en lugar de reconstruir.
Curiosamente, algunos modelos (como los esqueletos) parecían más elaborados que los de GPT 5.6 Sol. Esto no significa que sea mejor de ninguna manera, solo que en esta tarea produjo un esqueleto "bonito" mientras que el "rey" de la IA hizo una elección estilística más pobre.
El juego está disponible para probar aquí.
La escritura creativa es una historia más cualificada, y el criterio es más subjetivo.
En términos generales, los resultados no son particularmente imaginativos si tienes un prompt de "un solo intento" en mente.
Dicho esto, Bonsai produce historias con lógica interna consistente, ritmo y arco argumental —mejor, o a la par con Claude Haiku o incluso Sonnet con menor esfuerzo en prompts comparables. Para un modelo que se ejecuta completamente en tu propio hardware sin costos de API, eso es mucho que decir.
La historia que creó se puede encontrar en nuestro repositorio de Github.
PrismML también incluye una capa de decodificación especulativa DSpark junto con el modelo —un "borrador" ligero que propone bloques de tokens candidatos, que el modelo principal verifica en una sola pasada hacia adelante en lugar de generar token por token. En una H100, esto añade un aumento de rendimiento de 1.37x sin cambios en la calidad de la salida, ya que la verificación preserva la distribución exacta de la salida. En Apple Silicon aún no está habilitado por defecto, pero para el servicio de GPU es una ganancia real.
El interés de Apple añade una dimensión comercial. El CEO de PrismML, Babak Hassibi, confirmó a CNBC que la compañía está en conversaciones iniciales con Apple, que está evaluando la tecnología de compresión para un posible uso en dispositivos.
Hassibi dijo que un modelo Gemma comprimido es el siguiente en la hoja de ruta, seguido de modelos de frontera más grandes; el Bonsai 27B de 1 bit está disponible para descarga gratuita bajo la licencia Apache 2.0. Si necesitas una introducción sobre cómo ejecutar modelos como este localmente, consulta nuestra guía.