Bonsai 27B: Model 27B Chạy Trên Điện Thoại, Giữ 95% Hiệu Năng

PrismML vừa công bố Bonsai 27B — model ngôn ngữ 27 tỷ tham số đầu tiên chạy được trên điện thoại. Không phải demo, không phải phiên bản rút gọn — mà là model multimodal đầy đủ, hỗ trợ reasoning, coding, và agentic workflow, nén từ 54GB xuống còn 3.9GB mà vẫn giữ 90% hiệu năng so với bản full-precision.
Đây là bước nhảy Pareto thực sự: đưa sức mạnh của model 27B-class — vốn trước đây chỉ chạy trên cloud GPU — xuống thiết bị cá nhân.
Từ 54GB xuống 3.9GB: Bit Quantization làm được gì?
Một model 27B tham số ở độ chính xác 16-bit chiếm khoảng 54GB — vượt xa khả năng của bất kỳ smartphone hay laptop phổ thông nào. Ngay cả bản 4-bit cũng cần 18GB, vẫn quá lớn.
Bonsai 27B dùng kỹ thuật end-to-end low-bit quantization — không chỉ nén vài layer chọn lọc mà nén toàn bộ: embeddings, attention, MLP, LM head, không có "escape hatch" quay về full-precision ở bất kỳ tầng nào. Kết quả:
| Variant | Bit/weight | Kích thước | Benchmark vs FP16 | Chạy trên |
|---|---|---|---|---|
| Ternary (1.58-bit) | 1.71 effective | 5.9 GB | 95% | Laptop phổ thông |
| 1-bit Binary | 1.125 effective | 3.9 GB | 90% | iPhone 17 Pro |
Bản 1-bit đạt 11 token/s trên iPhone 17 Pro — tốc độ đọc được, đủ cho agentic workflow cục bộ. Để so sánh: bản 4-bit thông thường của cùng base model, tuy chiếm gấp 2.5x bộ nhớ, nhưng điểm benchmark vẫn thấp hơn bản 1-bit của PrismML.
Điểm mấu chốt không nằm ở số bit — mà ở intelligence density. PrismML định nghĩa chỉ số này là điểm benchmark chia cho GB bộ nhớ. Bonsai 27B 1-bit đạt 0.53/GB — gấp hơn 10 lần bản full-precision và gấp ~2.7 lần các phương pháp nén low-bit khác.
Đặt trong bối cảnh cạnh tranh: Google Gemma 3 (27B) yêu cầu GPU server, Microsoft Phi-4 (14B) vẫn cần ít nhất 8GB VRAM, còn Apple Intelligence chạy on-device nhưng là model nhỏ hơn nhiều (~3B). Bonsai 27B là model đầu tiên đưa được sức mạnh 27B-class thực thụ xuống thiết bị di động.
Không chỉ chat — model này được thiết kế để "làm việc"
Điểm khác biệt của Bonsai 27B so với các local model thông thường: nó không phải lightweight chatbot. PrismML xây dựng model này cho agentic workload — reasoning đa bước, gọi tool có cấu trúc, computer-use loop duy trì context qua hàng trăm bước.
Trên 15 benchmark (toán, code, tool calling, instruction following, vision, knowledge):
- Math: Ternary giữ 93.4% (từ 95.3% của FP16), 1-bit giữ 91.7%
- Coding: Ternary 86.0%, 1-bit 81.9% (HumanEval+, MBPP+, LiveCodeBench)
- Agentic & Tool-calling: Ternary 74.0%, 1-bit 66.0% (BFCL v3, TauBench)
Math và code gần như không bị ảnh hưởng bởi quantization — đúng những capability mà agentic workload phụ thuộc. Điều này không ngẫu nhiên: reasoning toán học và code generation dựa trên các pattern rời rạc, có cấu trúc chặt chẽ, nên ít bị suy giảm khi trọng số bị làm tròn. Ngược lại, các tác vụ liên tục như hiểu ảnh hoặc làm theo chỉ dẫn phức tạp đòi hỏi độ chính xác cao hơn ở từng weight — lý do vision và instruction following tụt nhiều hơn.
Model hỗ trợ 262K context window và speculative decoding — đọc được ảnh chụp màn hình, tài liệu, camera input ngay trên thiết bị. Cả vision tower cũng được nén xuống 4-bit.
Tại sao developer cần quan tâm?
Hơn một năm qua, xu hướng agentic AI đã thay đổi cách model được sử dụng: không còn là một lần gọi API → một câu trả lời, mà là hàng trăm lần gọi liên tiếp, mỗi lần mang context, sinh structured output, và nuôi bước tiếp theo.
Với pattern này, chi phí API và latency trở thành bottleneck. Các cloud model lớn vẫn cần cho tác vụ phức tạp, nhưng một agent chạy local — private, zero latency network, không rate limit — mở ra những use case mà trước đây bất khả thi:
- CI/CD agent trên dev machine: Một agent chạy Bonsai 27B có thể ngồi trong repo của bạn, tự động review từng commit, viết unit test cho code mới, phát hiện bug trước khi push — tất cả không cần gửi một dòng code nào lên cloud.
- On-device assistant cho công việc nhạy cảm: Đọc hợp đồng, phân tích tài liệu nội bộ, xử lý screenshot chứa dữ liệu khách hàng — tất cả diễn ra trên thiết bị, không data nào rời khỏi máy.
- Edge deployment: Ứng dụng yêu cầu reasoning phức tạp ở nơi không có internet ổn định — nhà máy, tàu biển, clinic vùng sâu.
Điều thú vị hơn: Bonsai 27B được release dưới Apache 2.0 — license cho phép dùng thương mại, không hạn chế. So với các model on-device khác thường bị giới hạn bởi license hoặc chỉ chạy qua API, đây là lựa chọn mở hoàn toàn.
Những điểm cần lưu ý
Cần giữ góc nhìn thực tế. Vision capability (MMMU Pro, OCRBench) tụt khá nhiều — ternary giữ 65.2% và 1-bit chỉ 59.6% so với FP16. Instruction following cũng giảm đáng kể (ternary 71.8%, 1-bit 65.8%).
Lý do: quantization làm tròn trọng số, ảnh hưởng nặng nhất đến các tác vụ yêu cầu độ chính xác cao ở từng weight — như hiểu chi tiết trong ảnh (mỗi pixel quan trọng) hoặc làm theo chỉ dẫn phức tạp (mỗi sắc thái ngữ nghĩa đều cần weight chính xác để giữ đúng ý). Ngược lại, toán và code có tính cấu trúc, redundancy cao hơn nên chịu đựng quantization tốt hơn.
Với các tác vụ yêu cầu làm theo chỉ dẫn phức tạp hoặc hiểu ảnh chi tiết, cloud model vẫn là lựa chọn tốt hơn. Bonsai 27B không thay thế Claude hay GPT — nó mở rộng phạm vi của những gì có thể chạy local.
Ngoài ra, mặc dù PrismML demos agentic loop trên iPhone 17 Pro, họ cũng lưu ý rằng demo trên điện thoại chạy với "cached and prefilled image context" — không phải live end-to-end. Hiệu năng thực tế trong workflow phức tạp vẫn cần kiểm chứng thêm từ cộng đồng.
Takeaways cho developer
- 27B-class AI đã lên được điện thoại — Ternary giữ 95% benchmark, 1-bit chạy trên iPhone 17 Pro với 11 token/s
- Apache 2.0 license — có thể dùng thương mại, tự do tích hợp vào sản phẩm
- Agentic-ready: hỗ trợ tool calling, 262K context, speculative decoding, multimodal (text + image)
- Không phải silver bullet: vision và instruction following vẫn thua cloud model đáng kể — chọn đúng task để triển khai
- Intelligence density > model size: chỉ số mới quan trọng hơn số tham số thô — Bonsai 27B gấp 10x full-precision về điểm/GB
Model 27B chạy trên điện thoại đã là hiện thực. Câu hỏi tiếp theo không phải "có chạy được không" — mà là "bạn sẽ build gì với nó?"
Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.
Related Posts
Local AI: Tại Sao Bạn Nên Chạy AI Trên Máy Của Riêng Mình
Chạy AI local không còn là chuyện viễn tưởng. Với Ollama và các model open-source, bạn có thể chạy LLM ngay trên laptop — private, free, không cần internet.
Cùng File Code, Claude Tính Token Nhiều Hơn GPT 73%
Bảng giá chỉ hiện $/token, nhưng mỗi model cắt cùng một file ra số token khác hẳn. Claude tokenizer mới đếm nhiều hơn GPT 73% cho TypeScript — ngôn ngữ coding agent dùng nhiều nhất.
GPT-5.6: OpenAI Vượt Claude Với Model Coding Nhanh Gấp Đôi, Rẻ Hơn 27%
GPT-5.6 Sol đạt 80 điểm Coding Agent Index, vượt Fable 5 với thời gian chỉ bằng một nửa. Ba model Sol/Terra/Luna ra mắt 9/7, có case study thực tế từ production xác nhận.