
Các mô hình AI tiêu tốn rất nhiều bộ nhớ. Một mô hình AI 27 tỷ tham số, được coi là kích thước trung bình theo tiêu chuẩn ngành, cần khoảng 54 GB bộ nhớ để chạy ở độ chính xác một nửa. Hầu hết các máy tính xách tay không thể chứa được dung lượng đó. Một số dàn máy tính để bàn cũng không thể.
Đầu tuần này, PrismML đã phát hành một mô hình với kích thước 3.9 GB — đủ nhỏ để chạy trên iPhone.
Tham số là số lượng các điều chỉnh và tinh chỉnh mà một mô hình có thể xử lý. Càng nhiều tham số, mô hình càng dày đặc và có khả năng hơn.
Bonsai 27B là mô hình thuộc lớp 27B đầu tiên vượt qua giới hạn bộ nhớ của một chiếc điện thoại thông minh tiêu dùng, chạy với tốc độ 11 token mỗi giây trên iPhone 17 Pro Max. (Token là đơn vị thông tin cơ bản mà các mô hình AI có thể xử lý và tạo ra.) Biến thể ba giá trị, với kích thước 5.9 GB, đạt khoảng 26 token mỗi giây trên một máy tính xách tay M5 Pro. Cả hai đều miễn phí theo giấy phép Apache 2.0.
Phương pháp nén, được xây dựng dựa trên tài sản trí tuệ của Caltech, giảm mỗi trọng số của mô hình từ độ chính xác dấu phẩy động 16 bit xuống một dấu duy nhất — +1 hoặc -1 trong bản dựng nhị phân, một trong ba giá trị trong bản dựng ba giá trị. Mỗi nhóm 128 trọng số chia sẻ một hệ số tỉ lệ 16 bit, đưa biến thể nhị phân xuống 1.125 bit mỗi trọng số: nhỏ hơn 14 lần so với bản gốc độ chính xác đầy đủ. Mô hình ba giá trị thêm trạng thái không để có sức biểu cảm tốt hơn một chút và ổn định ở 1.71 bit.
Nói một cách dễ hiểu hơn, điều này có nghĩa là một mô hình AI ba giá trị chỉ sử dụng ba cài đặt cho mỗi giá trị nội bộ — âm, không hoặc dương — trong khi một AI tiêu chuẩn có thể chọn từ khoảng 65.000 cài đặt.
PrismML đã làm được điều đó mà không làm giảm nhiều chất lượng đầu ra.
Điều làm cho mô hình này khác biệt so với các mô hình "ít bit" thông thường là không có thành phần nào được phép sử dụng độ chính xác cao hơn: các lớp nhúng (embeddings), cơ chế chú ý (attention) và toàn bộ phần đầu mô hình ngôn ngữ đều được nén từ đầu đến cuối. Hầu hết các bản dựng lượng tử hóa giữ một số lớp nhạy cảm ở độ chính xác đầy đủ, điều này cuối cùng làm tăng kích thước của chúng như một sự đánh đổi cho chất lượng tốt hơn. Bonsai không theo cách đó.
Đây là bản phát hành lớn thứ hai trong dòng sản phẩm. Vào tháng 3, PrismML đã ra mắt Bonsai 8B, một mô hình 1.15 GB đã chứng minh kiến trúc 1-bit có thể tồn tại ở 8 tỷ tham số mà không làm sụp đổ khả năng suy luận của nó. Bước nhảy vọt lên 27 tỷ là nơi mà mức độ quan trọng thay đổi — ở quy mô đó, suy luận chuỗi tư duy bền vững, sử dụng công cụ đáng tin cậy và hành vi tác nhân đa bước thực sự xuất hiện một cách nhất quán — những điều mà các mô hình nhỏ hơn vẫn còn lúng túng.
Trên 15 điểm chuẩn được đánh giá ở chế độ tư duy trên GPU NVIDIA H100 — bao gồm kiến thức, toán học, lập trình và sử dụng công cụ — Ternary Bonsai 27B đạt trung bình 80.49, tương đương 94.6% của mô hình độ chính xác đầy đủ. Biến thể 1-bit đạt 76.11.
Nhìn chung, trên các điểm chuẩn, các mô hình này hoạt động tốt hơn nhiều so với Gemma 4 hoặc Qwen 3.6 xét về tiềm năng mà chúng mang lại so với kích thước của chúng.
Các mô hình này khá tốt so với những gì chúng cung cấp, và xét đến lượng tài nguyên ít ỏi mà chúng yêu cầu, chúng nâng phần cứng nhỏ (điện thoại thông minh và PC cấp thấp) lên một tầm cao mới về khả năng. AIME25 và AIME26, được mô hình hóa theo Kỳ thi Toán học Mời gọi Hoa Kỳ, đạt 93.7% cho Ternary Bonsai 27B so với 95.3% cho Qwen 3.6B lớn hơn nhiều. Bonsai đạt 86 điểm trong lập trình so với 88 của Qwen 3.6 và 77% về kiến thức tổng quát so với 83 của Qwen 3.6.
Mô hình này cũng sử dụng kiến trúc chú ý lai (hybrid attention backbone) trong đó khoảng 75% các lớp là tuyến tính thay vì chú ý toàn phương (full quadratic attention). Kiến trúc đó là điều làm cho cửa sổ ngữ cảnh 262K token trở nên thực tế trên thiết bị — một ngăn xếp chú ý tiêu chuẩn sẽ khiến chi phí trở nên quá đắt trên phần cứng điện thoại.
Chúng tôi đã tự chạy Bonsai 27B. Lập trình đòi hỏi sự lặp lại: các nhắc lệnh đơn (single-shot prompts) sẽ không thể cạnh tranh với các mô hình tiên tiến trên đám mây. Việc chạy cục bộ và miễn phí khiến điều đó trở nên không liên quan. Đối với trò chơi Zombie Type của chúng tôi — một trò chơi kinh dị đánh máy góc nhìn thứ nhất trên trình duyệt — hai vòng lập trình cảm hứng đã tạo ra phát hiện va chạm sạch, logic tính điểm phù hợp và đồ họa mạch lạc. Mô hình nắm bắt cấu trúc sớm; lần chạy thứ hai tinh chỉnh thay vì xây dựng lại.
Điều thú vị là, một số mô hình (như bộ xương) trông phức tạp hơn so với những gì GPT 5.6 Sol tạo ra. Điều đó không có nghĩa là nó tốt hơn bằng mọi giá, chỉ là trong tác vụ này, nó đã tạo ra một bộ xương dễ thương trong khi "ông vua AI" lại đưa ra lựa chọn phong cách kém hơn.
Trò chơi có sẵn để thử nghiệm tại đây.
Viết sáng tạo là một câu chuyện có chất lượng hơn, và tiêu chí mang tính chủ quan hơn.
Nói một cách đại khái, kết quả không đặc biệt giàu trí tưởng tượng nếu bạn có một nhắc lệnh zero-shot trong đầu.
Tuy nhiên, Bonsai tạo ra những câu chuyện có logic nội bộ, nhịp độ và cấu trúc nhất quán — tốt hơn, hoặc ngang bằng với Claude Haiku hay thậm chí Sonnet với ít nỗ lực hơn trên các nhắc lệnh tương đương. Đối với một mô hình chạy hoàn toàn trên phần cứng của riêng bạn mà không tốn chi phí API, đó là một thành tựu đáng kể.
Câu chuyện nó tạo ra có thể tìm thấy trong kho lưu trữ Github của chúng tôi.
PrismML cũng cung cấp một lớp giải mã dự đoán DSpark cùng với mô hình — một trình soạn thảo nhẹ đề xuất các khối token ứng cử viên, mà mô hình chính sẽ xác minh trong một lần truyền tới duy nhất thay vì tạo từng token một. Trên một H100, điều này giúp tăng thông lượng 1.37 lần mà không thay đổi chất lượng đầu ra, vì việc xác minh bảo toàn phân phối đầu ra chính xác. Trên Apple Silicon, tính năng này chưa được bật theo mặc định, nhưng đối với việc phục vụ GPU, đó là một lợi ích thực sự.
Sự quan tâm của Apple bổ sung một khía cạnh thương mại. CEO của PrismML, Babak Hassibi, đã xác nhận với CNBC rằng công ty đang trong giai đoạn đàm phán ban đầu với Apple, hãng đang đánh giá công nghệ nén cho khả năng sử dụng trên thiết bị.
Hassibi cho biết một mô hình Gemma nén là tiếp theo trong lộ trình phát triển, tiếp theo là các mô hình tiên phong lớn hơn; 1-bit Bonsai 27B hiện có sẵn để tải xuống miễn phí theo giấy phép Apache 2.0. Nếu bạn cần hướng dẫn cơ bản về cách chạy các mô hình như thế này cục bộ, hãy xem hướng dẫn của chúng tôi.