Skip to content

Qwen3.8 27B: lượng tử hóa 4-bit đủ dùng, 1-bit thì vô dụng

Karify98 & Amy 🌸·
Cover Image for Qwen3.8 27B: lượng tử hóa 4-bit đủ dùng, 1-bit thì vô dụng

Bao nhiêu VRAM là đủ để chạy Qwen3.8 27B mà không mất chất lượng? Một benchmark độc lập vừa trả lời câu hỏi này bằng số liệu thật, không phải cảm tính từ Reddit.

Tác giả — nhà nghiên cứu độc lập tại Quesma — đốt khoảng 3.000 USD tiền thuê GPU trên Modal để chạy ba bộ benchmark: GPQA Diamond, IFBench, Terminal-Bench 2.1. Bộ benchmark này chạy trên bốn mức lượng tử hóa khác nhau của Qwen3.8 27B: 8-bit (29GB), 4-bit (17GB), 2-bit (10,7GB) và 1-bit (6,2GB). Kết quả xác nhận điều nhiều người đoán nhưng chưa ai đo kỹ. Nén mô hình không suy giảm đều — nó giữ nguyên chất lượng một hồi lâu, rồi rơi xuống vực.

Bản gốc 55GB, bản nén 17GB — không khác gì nhau

Model gốc ở định dạng BF16 nặng 55GB, vượt quá tầm với của hầu hết máy cá nhân. Bản Q4_K_M (4-bit, 17GB) từ Unsloth trên Hugging Face lại vừa khít card RTX 4090 24GB, còn dư chỗ cho khoảng 64.000 token ngữ cảnh.

Điểm bất ngờ: trên Terminal-Bench 2.1 — benchmark coding dạng agent với 89 tác vụ — bản 17GB cho kết quả ngang bằng bản gốc 55GB. Không phải "gần bằng", mà đúng nghĩa không đo được khác biệt. Tác giả còn tái lập chính xác điểm số chính thức của Qwen cho bản BF16 trước khi so sánh, nên đây không phải phép đo lỏng lẻo.

GPQA Diamond cho kết quả tương tự: gần như không có khác biệt tới tận mức 4-bit. Chỉ bản 2-bit mới bắt đầu tụt điểm rõ rệt. Trên IFBench — benchmark đo khả năng tuân thủ chỉ dẫn — thậm chí bản 2-bit (dưới 11GB) cũng không thua bản gốc.

2-bit vẫn dùng được, 1-bit thì không

Bản UD-Q2_K_XL (2-bit, 10,7GB) là ranh giới thú vị nhất. Trên Terminal-Bench, nó tụt điểm rõ so với 4-bit, nhưng vẫn ở tầm ngang Opus 4.7 hay Gemini 3.1 Pro trên cùng bảng xếp hạng — nghĩa là chưa phải frontier, nhưng còn xa mới tới mức vô dụng. Tác giả ghi nhận thêm: ở cùng số task giải được, bản 2-bit cần số lượt tương đương bản gốc nhưng viết ra nhiều hơn khoảng một phần tư token.

Bản UD-IQ1_S (1-bit, 6,2GB) là câu chuyện khác hẳn. Trên GPQA Diamond, nó cho điểm số quanh mức đoán mò ngẫu nhiên. Tệ hơn, việc tăng mức suy luận (reasoning effort) từ thấp lên "xhigh" lại làm nó tệ hơn — trái ngược với thông thường. Model dùng hết ngân sách token để suy nghĩ rồi trả về câu trả lời rỗng. Unsloth quảng cáo bản 1-bit giữ được khoảng 72% độ chính xác top-1 dù nhỏ hơn 89%, nhưng benchmark thực tế cho thấy 28% còn lại đó quan trọng hơn con số phần trăm gợi ý.

Cần lưu ý đây là benchmark của một nhà nghiên cứu độc lập, không phải test chính thức từ Alibaba hay đội Qwen. Kết quả đáng tin vì có phương pháp rõ ràng và tái lập được số liệu công bố, nhưng vẫn nên xem là một điểm dữ liệu, không phải phán quyết cuối cùng.

Điều cần biết

  • Chạy local trên GPU tiêu dùng: Q4_K_M (17GB) là lựa chọn mặc định hợp lý cho RTX 4090 hoặc card 24GB tương đương — không đánh đổi chất lượng đáng kể so với bản gốc.
  • Máy yếu hơn (dưới 12GB VRAM): bản 2-bit UD-Q2_K_XL vẫn dùng được cho tác vụ đơn giản, nhưng đừng kỳ vọng hiệu năng coding-agent ngang bản đầy đủ.
  • Tránh 1-bit cho tác vụ cần suy luận: với các bài toán khoa học, logic, hoặc coding phức tạp, bản 1-bit gần như vô dụng — tiết kiệm dung lượng không đáng so với chất lượng mất đi.
  • Effort setting ảnh hưởng nhiều hơn tưởng: mức reasoning effort (low/medium/xhigh) tác động tới điểm số mạnh hơn cả việc đổi từ 8-bit xuống 4-bit — đáng thử nghiệm trước khi đổi quantization.

Kết luận của tác giả đáng chú ý: lượng tử hóa nên được xem như công cụ bình thường, không phải thứ phải sợ. Vấn đề không phải "có nên nén hay không" mà là "nén tới đâu thì dừng" — và với Qwen3.8 27B, điểm dừng an toàn là 4-bit, còn 1-bit thì thà đừng chạy.


Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts