Qwen-Image 2.1: model nhỏ còn 7B nhưng license siết chặt hơn

Alibaba vừa công bố Qwen-Image 2.1 với kích thước chỉ bằng một phần ba bản tiền nhiệm nhưng chất lượng lại nhỉnh hơn hẳn, theo benchmark độc lập của cộng đồng. Cái giá phải trả: license đổi từ Apache 2.0 sang một dạng "chỉ dùng cho nghiên cứu".
Chuyện gì vừa xảy ra
Qwen team (thuộc Alibaba) ra mắt Qwen-Image 2.1 trên GitHub, Hugging Face và ModelScope hôm 20/9, kèm bài blog chính thức trên qwen.ai. Đây là bản kế tiếp của Qwen-Image 1.0 — model text-to-image mở weights ra mắt khoảng một năm trước.
Điểm khác biệt lớn nhất nằm ở kích thước: phần thành phần sinh ảnh của Qwen-Image 2.1 chỉ có 7B tham số (32 lớp Single-Stream DiT), so với 20B của bản open-weight 1.0. Model nhỏ hơn gần ba lần nhưng theo mô tả chính thức vẫn giữ được chất lượng sinh ảnh nhờ kiến trúc attention mixed-granularity và cơ chế tái sử dụng KV cache.
Bốn tính năng chính được Qwen team nhấn mạnh:
- Native transparency: sinh ảnh RGBA trong suốt trực tiếp từ text, không cần bước tách nền riêng
- Unified editing: chỉnh sửa layer trong suốt, tách chủ thể khỏi ảnh chụp — tất cả trong một model
- Versatile editing: hỗ trợ tới 10 ảnh tham chiếu, chỉnh sửa cục bộ bằng khoanh vùng hoặc mask
- Text rendering tốt hơn: cải thiện typography, ánh sáng chân dung, chi tiết ảnh
Benchmark độc lập: bước nhảy rõ rệt, nhưng chưa hoàn hảo
Số liệu chính thức từ Qwen team về điểm benchmark chuẩn hóa chưa được công bố đầy đủ tại thời điểm viết bài. Bù lại, một benchmark độc lập của cộng đồng (GenAI Showdown, do một thành viên HN vận hành, đánh giá thủ công trên 15 tiêu chí) ghi nhận Qwen-Image 2.1 đạt 7/15, gần gấp đôi so với 4/15 của bản 1.0. Đây là con số chưa qua kiểm chứng chính thức, cần xem là tham khảo chứ không phải benchmark academic.
Về tốc độ, một người dùng thử nghiệm trên RTX 4090 báo cáo sinh một ảnh 1 megapixel mất khoảng 5 giây — nhanh hơn đáng kể so với các model diffusion cỡ 20B cùng phân khúc, dù đây cũng chỉ là con số cá nhân, chưa phải benchmark chính thức từ Qwen team.
License: đây mới là phần gây tranh cãi
Qwen-Image 1.0 dùng Apache 2.0 — license mở, cho phép dùng thương mại tự do. Qwen-Image 2.1 chuyển sang Qwen Research License Agreement, cấm rõ ràng việc sử dụng thương mại trừ khi có thỏa thuận riêng với Alibaba.
Thảo luận trên Hacker News (bài đạt hơn 400 điểm, hơn 140 bình luận trong vài giờ) tập trung phần lớn vào điểm này. Nhiều người chỉ ra weights vẫn công khai nên về mặt kỹ thuật đây vẫn là "weights-available", nhưng gọi là open-source thì không chính xác — theo định nghĩa open-source truyền thống, hạn chế mục đích sử dụng thương mại đã đủ để loại khỏi nhóm này.
Đây không phải trường hợp cá biệt. Nhiều model ảnh mở weights ra mắt gần đây cũng chuyển hướng tương tự, rời xa Apache/MIT sang các license nghiên cứu hạn chế hơn — một phần vì lo ngại bị dùng để tạo nội dung deepfake, quảng cáo lừa đảo, hoặc tài khoản mạng xã hội giả.
So what — ảnh hưởng gì tới developer?
Nếu đang cân nhắc tự host một model text-to-image cho sản phẩm thương mại, Qwen-Image 2.1 tạm thời không phải lựa chọn hợp lệ trừ khi xin được giấy phép riêng từ Alibaba. Việc này áp dụng cho cả trường hợp tự host nội bộ nếu output phục vụ mục đích kinh doanh — license research không chỉ chặn việc bán API, mà chặn mọi hình thức thương mại hóa.
Với các dự án phi thương mại — công cụ nội bộ không sinh doanh thu, thử nghiệm cá nhân, nghiên cứu học thuật — model này vẫn đáng thử, đặc biệt nếu cần native transparency hoặc chỉnh sửa ảnh với nhiều ảnh tham chiếu. Kích thước 7B cũng có nghĩa là chi phí hạ tầng để tự host thấp hơn hẳn so với các model 20B+ cùng thế hệ, dễ chạy trên một GPU tiêu dùng thay vì cần cụm GPU.
Xu hướng đáng chú ý hơn cả con số: các phòng lab AI Trung Quốc đang chứng minh được rằng model nhỏ hơn không đồng nghĩa với yếu hơn — nhưng đồng thời cũng đang thu hẹp dần phạm vi "mở" thật sự của open-weight AI. Team nào từng mặc định "model Trung Quốc = license thoáng, dễ dùng thương mại" nên kiểm tra lại license của từng bản release mới, thay vì suy diễn theo tiền lệ.
Điều cần biết
- Qwen-Image 2.1 (Alibaba) ra mắt 20/9/2026: 7B tham số cho phần sinh ảnh, giảm gần 3 lần so với bản 1.0 (20B)
- Tính năng mới: native transparency (RGBA), chỉnh sửa với tối đa 10 ảnh tham chiếu, text rendering cải thiện
- License đổi từ Apache 2.0 sang Qwen Research License Agreement — cấm dùng thương mại nếu không xin phép riêng
- Benchmark cộng đồng độc lập (chưa chính thức): 7/15 so với 4/15 của bản 1.0 trên GenAI Showdown
- Dự án thương mại cần license riêng từ Alibaba; dự án phi thương mại/nghiên cứu dùng tự do
Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.
Related Posts
Qwen3.7-Max: Alibaba Đặt Cược Vào Agent AI — Và Có Lý Do Để Tin
Alibaba vừa ra mắt Qwen3.7-Max, mô hình AI tập trung vào khả năng agent. Đây không chỉ là một model mới — đó là tuyên bố chiến lược từ Trung Quốc trong cuộc đua AI agent toàn cầu.
Qwen3.8 27B: lượng tử hóa 4-bit đủ dùng, 1-bit thì vô dụng
Benchmark độc lập tốn 3.000 USD tiền GPU cho thấy bản 17GB của Qwen3.8 27B chạy ngang bản gốc 55GB — nhưng bản 1-bit thì gần như đoán mò.
Nvidia mua Hugging Face 12,9 tỷ USD: khép kín đế chế chip
Nvidia mua Hugging Face 12,9 tỷ USD — từ chip đến kho model nguồn mở. Developer nên lo hay nên mừng?