BerandaPusat Berita LBank
Temui Bonsai: Model AI 27B Pertama yang Muat di Ponsel Anda
meet-bonsai-first-27b-ai-model-fits-phone
Temui Bonsai: Model AI 27B Pertama yang Muat di Ponsel Anda
Bonsai 27B milik PrismML menjalankan AI penalaran penuh di iPhone secara gratis. Kami telah mengujinya, dan hasilnya sama mengesankannya seperti yang dibayangkan.
2026-07-15 Sumber:decrypt.co

Secara singkat

  • Bonsai 27B dari PrismML adalah model AI berparameter 27 miliar yang dikompresi menjadi 3,9 GB—cukup kecil untuk dijalankan di iPhone 17 Pro Max dengan kecepatan 11 token per detik, pertama kalinya model dengan tingkat kemampuan tersebut berhasil memenuhi anggaran memori ponsel pintar.
  • Varian ternary mempertahankan 94,6% kinerja benchmark presisi penuh, mengungguli build Qwen "2-bit" konvensional yang ukurannya hampir dua kali lipat dan gagal dalam tugas matematika dan pengodean di bawah 4 bit.
  • Apple sedang dalam pembicaraan awal dengan PrismML mengenai teknologi kompresi yang mendasari, menurut CNBC, dengan perusahaan menargetkan model Gemma terkompresi berikutnya dalam daftar.

Model AI memakan banyak memori. Model AI berparameter 27 miliar, yang dianggap berukuran sedang menurut standar industri, membutuhkan sekitar 54 GB memori untuk berjalan dengan presisi setengah. Sebagian besar laptop tidak dapat menampungnya. Beberapa perangkat desktop juga tidak bisa.

Awal pekan ini, PrismML merilis satu model berukuran 3,9 GB—cukup kecil untuk dimuat di iPhone.

Parameter adalah jumlah "tuas dan penyesuaian" yang dapat ditangani oleh suatu model. Semakin banyak parameter, semakin padat dan mampu model tersebut.

Bonsai 27B adalah model kelas 27B pertama yang melewati batas memori ponsel pintar konsumen, berjalan pada 11 token per detik di iPhone 17 Pro Max. (Token adalah unit dasar informasi yang dapat ditangani dan dihasilkan oleh model AI.) Varian ternary, dengan ukuran 5,9 GB, mencapai sekitar 26 token per detik di laptop M5 Pro. Keduanya tersedia secara gratis di bawah lisensi Apache 2.0.

Metode kompresi, yang dibangun di atas kekayaan intelektual Caltech, mengurangi setiap bobot model dari presisi floating-point 16 bit menjadi satu tanda—+1 atau -1 dalam build biner, salah satu dari tiga nilai dalam ternary. Setiap kelompok 128 bobot berbagi faktor penskalaan 16 bit, sehingga varian biner memiliki 1,125 bit per bobot: 14 kali lebih kecil dari aslinya yang presisi penuh. Model ternary menambahkan status nol untuk daya ekspresif yang sedikit lebih banyak dan menetap pada 1,71 bit.

Dalam istilah yang lebih mudah, ini berarti model AI ternary hanya menggunakan tiga pengaturan untuk setiap nilai internal—negatif, nol, atau positif—sementara AI standar dapat memilih dari sekitar 65.000 pengaturan.

PrismML melakukan itu tanpa kehilangan banyak kualitas output.

Yang membuat ini berbeda dari model "low-bit" konvensional adalah bahwa tidak ada yang mendapatkan "jalur keluar" presisi yang lebih tinggi: embeddings, attention, dan seluruh head model bahasa semuanya dikompresi ujung-ke-ujung. Sebagian besar build terkuantisasi menjaga lapisan-lapisan sensitif tertentu pada presisi penuh, yang akhirnya meningkatkan ukurannya sebagai kompromi untuk kualitas yang lebih baik. Bonsai tidak memainkan permainan itu.

Ini adalah rilis besar kedua dalam keluarga ini. Pada bulan Maret, PrismML mengirimkan Bonsai 8B, model 1,15 GB yang membuktikan arsitektur 1-bit dapat bertahan pada 8 miliar parameter tanpa penalarannya runtuh. Lompatan ke 27 miliar adalah tempat taruhannya berubah—skala itulah di mana penalaran "rantai pemikiran" yang berkelanjutan, penggunaan alat yang andal, dan perilaku keagenan multi-langkah benar-benar muncul secara konsisten—hal-hal yang masih sulit dilakukan oleh model yang lebih kecil.

Benchmark

Di antara 15 benchmark yang dievaluasi dalam mode berpikir pada GPU NVIDIA H100—meliputi pengetahuan, matematika, pengodean, dan penggunaan alat—Ternary Bonsai 27B rata-rata 80,49, atau 94,6% dari model presisi penuh. Varian 1-bit mencapai 76,11.

Secara keseluruhan, pada benchmark, model-model ini berkinerja jauh lebih baik daripada Gemma 4 atau Qwen 3.6 dalam hal potensi yang mereka tawarkan untuk ukurannya.

Model-model ini cukup bagus untuk apa yang mereka tawarkan, dan mengingat sedikitnya sumber daya yang mereka butuhkan, mereka membawa perangkat keras kecil (ponsel pintar dan PC kelas bawah) ke tingkat kemampuan yang berbeda. AIME25 dan AIME26, yang dimodelkan pada American Invitational Mathematics Examination, menunjukkan 93,7% untuk Ternary Bonsai 27B dibandingkan 95,3% untuk Qwen 3.6B yang jauh lebih besar. Bonsai mencetak 86 poin dalam pengodean dibandingkan 88 untuk Qwen 3.6 dan 77% pada pengetahuan umum versus 83 untuk Qwen 3.6.

Model ini juga menggunakan arsitektur attention hibrida di mana sekitar 75% dari lapisan bersifat linear daripada attention kuadratik penuh. Arsitektur itulah yang membuat jendela konteks 262K-token menjadi praktis di perangkat—sesuatu yang akan membuat tumpukan attention standar menjadi sangat mahal pada perangkat keras ponsel.

Kami mengujinya

Kami sendiri menjalankan Bonsai 27B. Pengodean membutuhkan iterasi: prompt sekali pakai tidak akan bersaing dengan model frontier cloud. Ketersediaan lokal dan gratis membuatnya tidak relevan. Untuk game Zombie Type kami—game browser horor pengetikan orang pertama—dua putaran pengodean "vibe" menghasilkan deteksi tabrakan yang bersih, logika penilaian yang tepat, dan grafik yang utuh. Model memahami struktur sejak awal; pengerjaan kedua menyempurnakan daripada membangun kembali.

Cukup menarik, beberapa model (seperti kerangka) terlihat lebih rumit daripada yang berasal dari GPT 5.6 Sol. Ini tidak berarti lebih baik sama sekali, hanya saja pada tugas ini ia menghasilkan kerangka yang lucu sementara raja AI membuat pilihan gaya yang lebih buruk.

Game ini tersedia untuk pengujian di sini.

Penulisan kreatif adalah cerita yang lebih berkualitas, dan kriterianya lebih subjektif.

Secara kasar, hasilnya tidak terlalu imajinatif jika Anda hanya menggunakan prompt sekali pakai (zero-shot prompt).

Meskipun demikian, Bonsai menghasilkan cerita dengan logika internal, ritme, dan alur yang konsisten—lebih baik, atau setara dengan Claude Haiku atau bahkan Sonnet dengan usaha yang lebih rendah pada prompt yang sebanding. Untuk model yang berjalan sepenuhnya pada perangkat keras Anda sendiri tanpa biaya API, itu adalah pencapaian yang luar biasa.

Cerita yang dibuatnya dapat ditemukan di repositori Github kami.

PrismML juga mengirimkan lapisan dekode spekulatif DSpark bersama model—sebuah drafter ringan yang mengusulkan blok-blok token kandidat, yang diverifikasi oleh model utama dalam satu kali forward pass daripada menghasilkan token per token. Pada H100 ini menambahkan peningkatan throughput 1,37x tanpa perubahan kualitas output, karena verifikasi mempertahankan distribusi output yang tepat. Pada Apple Silicon belum diaktifkan secara default, tetapi untuk serving GPU ini adalah keuntungan nyata.

Minat Apple menambah dimensi komersial. CEO PrismML Babak Hassibi mengkonfirmasi kepada CNBC bahwa perusahaan sedang dalam pembicaraan awal dengan Apple, yang sedang mengevaluasi teknologi kompresi untuk potensi penggunaan di perangkat.

Hassibi mengatakan model Gemma terkompresi adalah proyek berikutnya, diikuti oleh model frontier yang lebih besar; Bonsai 27B 1-bit sekarang tersedia untuk diunduh gratis di bawah Apache 2.0. Jika Anda membutuhkan pengantar untuk menjalankan model seperti ini secara lokal, lihat panduan kami.