AcasăCentrul de știri LBank
Vă prezentăm Bonsai: Primul model AI de 27B care încape pe telefonul tău
meet-bonsai-first-27b-ai-model-fits-phone
Vă prezentăm Bonsai: Primul model AI de 27B care încape pe telefonul tău
Bonsai 27B de la PrismML rulează inteligență artificială de raționament complet pe un iPhone gratuit. Am testat-o și este la fel de impresionantă pe cât sună.
2026-07-15 Sursă:decrypt.co

Pe scurt

  • Bonsai 27B de la PrismML este un model AI cu 27 de miliarde de parametri, comprimat la 3,9 GB – suficient de mic pentru a rula pe un iPhone 17 Pro Max la 11 tokenuri pe secundă, fiind pentru prima dată când un model de un astfel de nivel de capabilitate se încadrează în bugetul de memorie al unui smartphone.
  • Varianta ternară reține 94,6% din performanța de referință a preciziei complete, depășind construcțiile Qwen convenționale „2-bit” care sunt de aproape două ori mai mari și eșuează la sarcini de matematică și codare sub 4 biți.
  • Apple se află în discuții preliminare cu PrismML despre tehnologia de compresie subiacentă, conform CNBC, compania vizând un model Gemma comprimat ca următorul pas în dezvoltare.

Modelele AI consumă multă memorie. Un model AI cu 27 de miliarde de parametri, considerat de dimensiuni medii conform standardelor industriei, necesită aproximativ 54 GB de memorie pentru a rula la precizie jumătate. Majoritatea laptopurilor nu pot suporta asta. Nici unele sisteme desktop nu pot.

La începutul acestei săptămâni, PrismML a lansat un model de 3,9 GB – suficient de mic pentru a încăpea pe un iPhone.

Parametrii reprezintă numărul de reglaje și ajustări pe care le poate gestiona un model. Cu cât mai mulți parametri, cu atât un model este mai dens și mai capabil.

Bonsai 27B este primul model din clasa 27B care depășește limita de memorie a unui smartphone de consum, rulând la 11 tokenuri pe secundă pe un iPhone 17 Pro Max. (Tokenurile sunt unitatea de bază de informație pe care modelele AI o pot gestiona și produce.) Varianta ternară, la 5,9 GB, atinge aproximativ 26 de tokenuri pe secundă pe un laptop M5 Pro. Ambele sunt gratuite sub licența Apache 2.0.

Metoda de compresie, construită pe proprietatea intelectuală Caltech, reduce fiecare pondere a modelului de la o precizie în virgulă mobilă de 16 biți la un singur semn — +1 sau -1 în construcția binară, una dintre cele trei valori în cea ternară. Fiecare grup de 128 de ponderi partajează un factor de scalare de 16 biți, aducând varianta binară la 1,125 biți per pondere: de 14 ori mai mică decât originalul cu precizie completă. Modelul ternar adaugă o stare zero pentru o putere expresivă ușor mai mare și se stabilizează la 1,71 biți.

În termeni mai simpli, aceasta înseamnă că un model AI ternar utilizează doar trei setări pentru fiecare valoare internă – negativ, zero sau pozitiv – în timp ce un AI standard poate alege dintre aproximativ 65.000 de setări.

PrismML a realizat acest lucru fără a pierde mult din calitatea rezultatului.

Ceea ce diferențiază acest lucru de modelele convenționale „low-bit” este că nimic nu primește o „cale de evacuare” de precizie superioară: embeddings, atenția și întreaga structură a modelului lingvistic sunt toate comprimate de la un capăt la altul. Majoritatea construcțiilor cuantificate mențin anumite straturi sensibile la precizie completă, ceea ce ajunge să le mărească dimensiunea ca un compromis pentru o calitate mai bună. Bonsai nu joacă acest joc.

Aceasta este a doua lansare majoră din familie. În martie, PrismML a livrat Bonsai 8B, un model de 1,15 GB care a demonstrat că arhitectura de 1 bit poate supraviețui la 8 miliarde de parametri fără ca raționamentul său să se prăbușească. Saltul la 27 de miliarde este momentul în care miza se schimbă — această scară este cea în care raționamentul susținut de tip "lanț de gândire", utilizarea fiabilă a instrumentelor și comportamentul agentic în mai mulți pași apar de fapt în mod constant — lucruri pe care modelele mai mici încă le bâjbâie.

Criterii de performanță

Pe parcursul a 15 criterii de performanță evaluate în modul de gândire pe GPU-uri NVIDIA H100 — cuprinzând cunoștințe, matematică, codare și utilizarea uneltelor — Bonsai 27B ternar obține o medie de 80,49, sau 94,6% din modelul cu precizie completă. Varianta de 1 bit atinge 76,11.

În general, la criterii de performanță, modelele se descurcă mult mai bine decât Gemma 4 sau Qwen 3.6 în ceea ce privește potențialul pe care îl oferă pentru dimensiunea lor.

Modelele sunt destul de bune pentru ceea ce oferă și, având în vedere cât de puține resurse necesită, duc hardware-ul mic (smartphone-uri și PC-uri de gamă inferioară) la un alt nivel în ceea ce privește capabilitățile. AIME25 și AIME26, modelate după American Invitational Mathematics Examination, înregistrează 93,7% pentru Ternary Bonsai 27B versus 95,3% pentru Qwen 3.6B, mult mai mare. Bonsai obține 86 de puncte la codare față de 88 pentru Qwen 3.6 și 77% la cunoștințe generale față de 83 pentru Qwen 3.6.

Modelul utilizează, de asemenea, o arhitectură de atenție hibridă, unde aproximativ 75% dintre straturi sunt liniare, mai degrabă decât atenție pătratică completă. Această arhitectură este ceea ce face ca o fereastră de context de 262K tokenuri să fie practică pe dispozitiv — ceva ce o stivă de atenție standard ar face prohibitiv de scumpă pe hardware-ul telefonului.

L-am testat

Am rulat Bonsai 27B noi înșine. Codarea necesită iterație: prompturile „single-shot” nu vor concura cu modelele cloud de vârf. Faptul că este local și gratuit face acest lucru irelevant. Pentru jocul nostru Zombie Type — un joc de groază cu tastare la persoana întâi, bazat pe browser — două runde de codare "vibe" au produs o detectare curată a coliziunilor, o logică adecvată de punctaj și o grafică ce s-a menținut coerentă. Modelul înțelege structura devreme; a doua trecere rafinează, mai degrabă decât reconstruiește.

Interesant este că unele modele (cum ar fi scheletele) păreau mai elaborate decât cele de la GPT 5.6 Sol. Nu înseamnă că este mai bun în niciun fel, ci doar că, la această sarcină, a produs un schelet drăguț, în timp ce regele AI a făcut o alegere stilistică mai slabă.

Jocul este disponibil pentru testare aici.

Scrierea creativă este o poveste mai nuanțată, iar criteriile sunt mai subiective.

În linii mari, rezultatele nu sunt deosebit de imaginative dacă ai în minte un prompt "zero-shot".

Acestea fiind spuse, Bonsai produce povești cu logică internă consistentă, ritm și arc narativ — mai bune sau la egalitate cu Claude Haiku sau chiar Sonnet cu un efort mai mic la prompturi comparabile. Pentru un model care rulează în întregime pe propriul hardware, fără costuri API, asta spune multe.

Povestea creată de acesta poate fi găsită în depozitul nostru Github.

PrismML livrează, de asemenea, un strat de decodare speculativă DSpark alături de model — un "drafting engine" ușor care propune blocuri de tokenuri candidate, pe care modelul principal le verifică printr-o singură trecere înainte, mai degrabă decât să genereze token cu token. Pe un H100, acest lucru adaugă o creștere de 1,37x a debitului, fără nicio modificare a calității rezultatului, deoarece verificarea păstrează distribuția exactă a ieșirilor. Pe Apple Silicon nu este încă activat implicit, dar pentru servirea GPU este un câștig real.

Interesul Apple adaugă o dimensiune comercială. CEO-ul PrismML, Babak Hassibi, a confirmat pentru CNBC că firma se află în discuții preliminare cu Apple, care evaluează tehnologia de compresie pentru o potențială utilizare pe dispozitive.

Hassibi a declarat că un model Gemma comprimat este următorul în dezvoltare, urmat de modele de frontieră mai mari; 1-bit Bonsai 27B este disponibil pentru descărcare gratuită acum sub licența Apache 2.0. Dacă aveți nevoie de un ghid introductiv pentru rularea locală a unor astfel de modele, consultați ghidul nostru.