
Modelos de IA consomem muita memória. Um modelo de IA de 27 bilhões de parâmetros, considerado de tamanho médio pelos padrões da indústria, precisa de aproximadamente 54 GB de memória para rodar em meia precisão. A maioria dos laptops não consegue suportar isso. Alguns desktops também não.
No início desta semana, a PrismML lançou um modelo de 3,9 GB – pequeno o suficiente para caber em um iPhone.
Parâmetros são o número de ajustes e configurações que um modelo pode manipular. Quanto mais parâmetros, mais denso e capaz é um modelo.
O Bonsai 27B é o primeiro modelo da classe 27B a superar o limite de memória de um smartphone de consumidor, rodando a 11 tokens por segundo em um iPhone 17 Pro Max. (Tokens são a unidade básica de informação que os modelos de IA podem processar e produzir.) A variante ternária, com 5,9 GB, atinge cerca de 26 tokens por segundo em um laptop M5 Pro. Ambos são gratuitos sob a licença Apache 2.0.
O método de compressão, construído com propriedade intelectual do Caltech, reduz cada peso do modelo de 16 bits de precisão de ponto flutuante para um único sinal — +1 ou -1 na compilação binária, um de três valores na ternária. Cada grupo de 128 pesos compartilha um fator de escala de 16 bits, resultando na variante binária em 1,125 bits por peso: 14 vezes menor que o original de precisão total. O modelo ternário adiciona um estado zero para um poder expressivo ligeiramente maior e se estabelece em 1,71 bits.
Em termos mais simples, isso significa que um modelo de IA ternário usa apenas três configurações para cada valor interno — negativo, zero ou positivo — enquanto uma IA padrão pode escolher entre cerca de 65.000 configurações.
A PrismML fez isso sem perder muito da qualidade da saída.
O que o diferencia dos modelos "de baixo bit" convencionais é que nada recebe uma "saída de emergência" de maior precisão: embeddings, atenção e o cabeçalho completo do modelo de linguagem são todos compactados de ponta a ponta. A maioria das construções quantizadas mantém certas camadas sensíveis em precisão total, o que acaba aumentando seu tamanho como uma compensação por melhor qualidade. O Bonsai não joga esse jogo.
Este é o segundo grande lançamento da família. Em março, a PrismML lançou o Bonsai 8B, um modelo de 1,15 GB que provou que a arquitetura de 1 bit poderia sobreviver com 8 bilhões de parâmetros sem que seu raciocínio colapsasse. O salto para 27 bilhões é onde as apostas mudam — essa escala é onde o raciocínio encadeado sustentado, o uso confiável de ferramentas e o comportamento agêntico de múltiplas etapas realmente surgem de forma consistente — coisas com as quais modelos menores ainda tropeçam.
Em 15 benchmarks avaliados em modo de pensamento em GPUs NVIDIA H100 — abrangendo conhecimento, matemática, codificação e uso de ferramentas — o Bonsai 27B Ternário obteve uma média de 80,49, ou 94,6% do modelo de precisão total. A variante de 1 bit atingiu 76,11.
No geral, nos benchmarks, os modelos têm um desempenho muito melhor do que o Gemma 4 ou o Qwen 3.6 em termos do potencial que oferecem para seu tamanho.
Os modelos são muito bons para o que oferecem, e considerando a pouca quantidade de recursos que exigem, eles elevam o hardware pequeno (smartphones e PCs de baixo custo) a outro nível em termos de capacidades. O AIME25 e o AIME26, modelados no American Invitational Mathematics Examination, registram 93,7% para o Bonsai 27B Ternário versus 95,3% para o Qwen 3.6B, muito maior. O Bonsai pontua 86 em codificação contra 88 para o Qwen 3.6 e 77% em conhecimento geral contra 83 para o Qwen 3.6.
O modelo também utiliza uma arquitetura de atenção híbrida onde aproximadamente 75% das camadas são lineares, em vez de atenção quadrática completa. Essa arquitetura é o que torna uma janela de contexto de 262K tokens prática em dispositivos – algo que uma pilha de atenção padrão tornaria proibitivamente caro em hardware de telefone.
Nós mesmos testamos o Bonsai 27B. A codificação exige iteração: prompts de única tentativa não competem com modelos de ponta baseados em nuvem. Ser local e gratuito torna isso irrelevante. Para o nosso jogo Zombie Type — um jogo de digitação de terror em primeira pessoa para navegador — duas rodadas de codificação 'vibe' produziram detecção de colisão limpa, lógica de pontuação adequada e gráficos que se mantiveram coesos. O modelo compreende a estrutura cedo; a segunda passagem refina em vez de reconstruir.
Curiosamente, alguns modelos (como os esqueletos) pareciam mais elaborados do que os do GPT 5.6 Sol. Isso não significa que seja melhor de forma alguma, apenas que nesta tarefa produziu um esqueleto fofo enquanto o rei da IA fez uma escolha estilística mais pobre.
O jogo está disponível para teste aqui.
A escrita criativa é uma história mais qualificada, e o critério é mais subjetivo.
Em termos gerais, os resultados não são particularmente imaginativos se você tiver um prompt de 'zero-shot' em mente.
Dito isso, o Bonsai produz histórias com lógica interna consistente, ritmo e arco — melhores, ou no mesmo nível de Claude Haiku ou até mesmo Sonnet com menos esforço em prompts comparáveis. Para um modelo que roda inteiramente no seu próprio hardware sem custos de API, isso é muito a dizer.
A história que ele criou pode ser encontrada em nosso repositório no Github.
A PrismML também oferece uma camada de decodificação especulativa DSpark junto com o modelo — um rascunhador leve que propõe blocos de tokens candidatos, que o modelo principal verifica em uma única passagem direta em vez de gerar token por token. Em uma H100, isso adiciona um aumento de 1,37x na taxa de transferência sem alteração na qualidade da saída, já que a verificação preserva a distribuição exata da saída. No Apple Silicon, ainda não está habilitado por padrão, mas para servir em GPU é um ganho real.
O interesse da Apple adiciona uma dimensão comercial. O CEO da PrismML, Babak Hassibi, confirmou à CNBC que a empresa está em negociações iniciais com a Apple, que está avaliando a tecnologia de compressão para potencial uso em dispositivos.
Hassibi afirmou que um modelo Gemma compactado é o próximo na linha de desenvolvimento, seguido por modelos de fronteira maiores; o Bonsai 27B de 1 bit está disponível para download gratuito agora sob a licença Apache 2.0. Se você precisa de um guia para rodar modelos como este localmente, confira nosso tutorial.





