
Malaking memorya ang kinakain ng mga modelo ng AI. Ang isang 27-bilyong-parameter na modelo ng AI, na itinuturing na katamtamang laki ayon sa mga pamantayan ng industriya, ay nangangailangan ng humigit-kumulang 54 GB ng memorya upang tumakbo sa half precision. Karamihan sa mga laptop ay hindi kaya iyon. Maging ang ilang desktop rigs ay hindi rin.
Mas maaga ngayong linggo, naglabas ang PrismML ng isa sa 3.9 GB—sapat na maliit para magkasya sa isang iPhone.
Ang mga parameter ay ang bilang ng mga setting at pagbabago na kayang hawakan ng isang modelo. Kung mas maraming parameter, mas siksik at mas may kakayahan ang isang modelo.
Ang Bonsai 27B ang unang 27B-class na modelo na nakalampas sa limitasyon ng memorya ng isang consumer smartphone, tumatakbo sa 11 tokens kada segundo sa isang iPhone 17 Pro Max. (Ang mga token ay ang pangunahing yunit ng impormasyon na kayang iproseso at buuin ng mga modelo ng AI.) Ang ternary variant, sa 5.9 GB, ay umaabot sa humigit-kumulang 26 tokens kada segundo sa isang M5 Pro laptop. Pareho itong libre sa ilalim ng Apache 2.0.
Ang pamamaraan ng compression, na binuo batay sa intellectual property ng Caltech, binabawasan ang bawat 'weight' ng modelo mula sa 16 bits ng floating-point precision patungo sa isang single sign—+1 o -1 sa binary build, isa sa tatlong halaga sa ternary. Ang bawat grupo ng 128 na weights ay mayroong 16-bit na scaling factor, na nagreresulta sa binary variant na 1.125 bits kada weight: 14 na beses na mas maliit kaysa sa orihinal na full-precision. Ang ternary model ay nagdaragdag ng zero state para sa bahagyang mas 'expressive' na kapangyarihan at nagtatapos sa 1.71 bits.
Sa mas madaling salita, nangangahulugan ito na ang isang ternary AI model ay gumagamit lamang ng tatlong setting para sa bawat internal na halaga—negatibo, zero, o positibo—habang ang isang standard AI ay maaaring pumili mula sa humigit-kumulang 65,000 setting.
Ginawa ito ng PrismML nang hindi nawawalan ng gaanong kalidad ng output.
Ang pinagkaiba nito sa mga conventional "low-bit" na modelo ay walang nakakakuha ng mas mataas na-precision na "escape hatch": ang mga embeddings, attention, at ang buong language model head ay kinompres lahat mula simula hanggang dulo. Karamihan sa mga quantized na build ay pinapanatili ang ilang sensitibong layer sa full precision, na nagtatapos sa pagtaas ng kanilang laki bilang kapalit ng mas mahusay na kalidad. Hindi nilalaro ng Bonsai ang larong iyon.
Ito ang ikalawang pangunahing paglabas sa serye. Noong Marso, inilabas ng PrismML ang Bonsai 8B, isang 1.15 GB na modelo na nagpatunay na ang 1-bit architecture ay kayang manatili sa 8 bilyong parameter nang hindi bumabagsak ang kakayahan nito sa pangangatwiran. Ang pagtalon sa 27 bilyon ay kung saan nagbabago ang mga pusta—sa sukat na iyon, ang patuloy na chain-of-thought reasoning, maaasahang paggamit ng tool, at multi-step na agentic behavior ay lumilitaw nang tuloy-tuloy—ang mga bagay na kinakapa pa rin ng mas maliliit na modelo.
Sa kabila ng 15 benchmark na sinuri sa 'thinking mode' sa NVIDIA H100 GPUs—sumasaklaw sa kaalaman, matematika, coding, at paggamit ng tool—ang Ternary Bonsai 27B ay nag-a-average ng 80.49, o 94.6% ng full-precision model. Ang 1-bit variant ay umabot sa 76.11.
Sa pangkalahatan, sa mga benchmark, ang mga modelo ay mas mahusay ang performance kaysa sa Gemma 4 o Qwen 3.6 sa kung gaano kalaki ang potensyal na iniaalok nila para sa kanilang laki.
Ang mga modelo ay maganda para sa iniaalok nila, at isinasaalang-alang kung gaano kaliit na resources ang kailangan nila, dinadala nila ang maliliit na hardware (smartphones at mababang-end na PC) sa ibang antas sa mga tuntunin ng kakayahan. Ang AIME25 at AIME26, na minodelo sa American Invitational Mathematics Examination, ay nagtala ng 93.7% para sa Ternary Bonsai 27B kumpara sa 95.3% para sa mas malaking Qwen 3.6B. Nakakuha ang Bonsai ng 86 puntos sa coding kumpara sa 88 para sa Qwen 3.6 at 77% sa pangkalahatang kaalaman kumpara sa 83 para sa Qwen 3.6.
Gumagamit din ang modelo ng hybrid attention backbone kung saan humigit-kumulang 75% ng mga layer ay linear sa halip na full quadratic attention. Ang arkitekturang iyon ang nagpapraktikal sa isang 262K-token context window sa device—isang bagay na gagawing napakamahal ng isang standard attention stack sa hardware ng telepono.
Sinubukan namin mismo ang Bonsai 27B. Ang coding ay nangangailangan ng pag-ulit: ang mga single-shot prompt ay hindi makikipagkompetensya sa mga cloud frontier models. Ang pagiging lokal at libre ay ginagawang hindi mahalaga iyon. Para sa aming laro na Zombie Type—isang first-person typing-horror browser game—dalawang "vibe coding rounds" ang gumawa ng malinis na collision detection, tamang scoring logic, at graphics na nagkakabit-kabit. Maaga nitong naiintindihan ang istraktura ng modelo; ang pangalawang pagdaan ay pinipino sa halip na muling itayo.
Sa nakakatuwa, ang ilang modelo (tulad ng mga kalansay) ay mukhang mas detalyado kaysa sa mga mula sa GPT 5.6 Sol. Hindi ibig sabihin nito na mas mahusay ito sa anumang paraan, kundi sa gawaing ito ay gumawa ito ng isang 'cute' na kalansay habang ang AI king ay gumawa ng mas mahinang pagpipilian sa estilo.
Ang laro ay available para sa pagsubok dito.
Ang malikhaing pagsusulat ay isang mas kwalipikadong kuwento, at ang pamantayan ay mas subjective.
Sa madaling salita, ang mga resulta ay hindi partikular na mapanlikha kung mayroon kang 'zero-shot prompt' sa isip.
Gayunpaman, ang Bonsai ay gumagawa ng mga kuwento na may pare-parehong internal na lohika, pacing, at arc—mas mahusay, o katumbas ng Claude Haiku o maging ng Sonnet sa mas kaunting pagsisikap sa magkatulad na prompts. Para sa isang modelo na tumatakbo nang buo sa sarili mong hardware nang walang API costs, malaki na ang masabi doon.
Ang kuwentong nilikha nito ay matatagpuan sa aming Github repository.
Nagpapadala rin ang PrismML ng DSpark speculative decoding layer kasama ng modelo—isang magaan na 'drafter' na nagmumungkahi ng mga bloke ng mga kandidatong token, na ini-verify ng pangunahing modelo sa isang solong forward pass sa halip na bumuo ng token-by-token. Sa isang H100, nagdaragdag ito ng 1.37x na pagtaas sa throughput nang walang pagbabago sa kalidad ng output, dahil pinapanatili ng verification ang eksaktong distribusyon ng output. Sa Apple Silicon, hindi pa ito naka-enable bilang default, ngunit para sa GPU serving, ito ay isang tunay na pakinabang.
Ang interes ng Apple ay nagdaragdag ng komersyal na dimensyon. Kinumpirma ni PrismML CEO Babak Hassibi sa CNBC na ang kumpanya ay nakikipag-usap na sa Apple, na kasalukuyang sinusuri ang teknolohiya ng compression para sa potensyal na paggamit sa device.
Sinabi ni Hassibi na ang isang compressed Gemma model ang susunod na ilalabas, na susundan ng mas malalaking frontier models; ang 1-bit Bonsai 27B ay available para sa libreng pag-download ngayon sa ilalim ng Apache 2.0. Kung kailangan mo ng gabay sa pagpapatakbo ng mga modelong tulad nito nang lokal, tingnan ang aming gabay.