Tencent Hy4: mô hình mở 770B tham số, tự tối ưu hệ thống suy luận

Tencent vừa công bố và mở mã nguồn Hy4 preview — LLM thế hệ mới với 770 tỷ tham số tổng, 49 tỷ tham số kích hoạt và cửa sổ ngữ cảnh hơn 1 triệu token. Nhưng điểm đáng chú ý nhất không nằm ở bảng benchmark: Hy4 đã tự tối ưu chính hệ thống inference của nó, giúp throughput tăng 31,8%.
Hy4 thuộc dòng Hunyuan của Tencent — dòng model gắn bó chặt với CodeBuddy và WorkBuddy, hai sản phẩm AI năng suất của hãng. Thay vì chạy đua điểm số, Tencent định vị Hy4 là model cho công việc thực tế: lập trình, văn phòng, nghiên cứu khoa học. Đây là bản "preview", theo cách tiếp cận phát hành sớm để lấy phản hồi rồi mới ra bản chính thức — nhóm model kế tiếp trong dòng Hy4 được hứa sẽ sớm ra mắt.
Kiến trúc: lớn nhưng "rẻ" nhờ MoE
Hy4 dùng cấu trúc đặc trưng của MoE: 770 tỷ tham số tổng nhưng chỉ 49 tỷ tham số kích hoạt mỗi lần chạy. Đây là con số then chốt về chi phí. Một model dense 770 tỷ cần hàng chục GPU để chạy, còn Hy4 về lý thuyết chỉ tính toán trên phần nhỏ đó — chi phí suy luận giảm mạnh trong khi vẫn giữ dung lượng kiến thức lớn.
Cửa sổ ngữ cảnh hơn 1 triệu token là bước nhảy đáng kể, nhắm thẳng vào các tác vụ dài: đọc toàn bộ codebase, xử lý tài liệu chéo nhau, hay bài toán nghiên cứu cần ngữ cảnh rộng. Tencent nhấn mạnh Hy4 được tinh chỉnh để hiểu, lập kế hoạch, debug và kiểm chứng trong các tác vụ phát triển phần mềm ngữ cảnh dài.
Hiệu năng — và vì sao phải đọc kỹ nguồn
Trong một đánh giá mù nội bộ với 163 chuyên gia trên 203 tác vụ kỹ thuật, Hy4 đạt trung bình 2,99/4,00, nhỉnh hơn GLM-5.3 (2,92) và Kimi K3 (2,94). Đây là số liệu do chính Tencent công bố, không phải benchmark của bên thứ ba — nên đọc với mức độ hoài nghi phù hợp.
Đáng chú ý là Tencent gần như không công bố điểm trên các benchmark công khai quen thuộc (kiểu SWE-bench hay MMLU). Thay vào đó, hãng kể chuyện "năng suất thực tế": tạo prototype game chạy được từ một câu lệnh ngôn ngữ tự nhiên, phân tích tài chính, cộng tác đa tài liệu. Đó là lựa chọn định vị có chủ đích — nhắm vào doanh nghiệp và developer thực dụng hơn là cộng đồng nghiên cứu.
Điểm khác biệt: model tự cải thiện chính nó
Phần thú vị nhất của thông báo nằm ở chỗ Hy4 đã tham gia vào quá trình phát triển của chính nó. Theo Tencent, model tự đề xuất phương pháp huấn luyện, chiến lược dữ liệu, khung đánh giá và các low-level operator. Sau đó nó chạy thí nghiệm và lặp lại dựa trên kết quả — code, log và phản hồi được đưa vào các vòng thăm dò tiếp theo. Đây là vòng lặp tự cải thiện (recursive self-improvement) ở giai đoạn đầu.
Cụ thể và đo lường được hơn: Hy4 tự phân tích các điểm nghẽn trong hệ thống inference của nó, rồi thực hiện nhiều vòng tối ưu như operator fusion và tối ưu giao tiếp. Kết quả là throughput end-to-end tăng 31,8% so với baseline, ổn định trên nhiều độ dài ngữ cảnh và mức độ đồng thời khác nhau.
Cần giữ đúng liều lượng hoài nghi ở đây: tất cả đều là claim một phía từ Tencent. "Model tự tối ưu chính nó" là khẩu hiệu dễ gây ấn tượng, nhưng để kiểm chứng cần thêm bằng chứng độc lập và tái lập được. Dẫu vậy, hướng đi này đáng theo dõi — nó nằm đúng điểm giao giữa tự động hóa huấn luyện và nghiên cứu AI tự cải thiện vốn đang được nhiều lab lớn để mắt.
Giá và khả năng tiếp cận
Hy4 preview được miễn phí hai tuần trên WorkBuddy và CodeBuddy; quyền truy cập miễn phí Hy3 được gia hạn tới 30/9. Qua API, giá niêm yết là 0,834 USD cho mỗi triệu token đầu vào, 2,501 USD cho mỗi triệu token đầu ra, và 0,042 USD cho mỗi triệu token cache hit. Có thể gọi qua Tencent Cloud TokenHub hoặc OpenRouter.
Với mức giá này, Hy4 đặt mình cạnh tranh trực tiếp trong nhóm model mở Trung Quốc — DeepSeek, Qwen, GLM, Kimi — vốn đang chạy đua về giá lẫn khả năng. Tín hiệu miễn phí hai tuần cho thấy Tencent muốn kéo developer dùng thử nhanh, thay vì chỉ công bố rồi chờ.
Ảnh hưởng gì tới developer
- Ai gọi qua API: 0,834 USD cho mỗi triệu token đầu vào là mức rẻ, và model có sẵn trên OpenRouter. Hai tuần miễn phí trên CodeBuddy đủ để thử nhanh.
- Ai có hạ tầng GPU: 49 tỷ tham số kích hoạt giúp chi phí mỗi token thấp hơn hẳn model dense 770 tỷ. Nhưng toàn bộ weight vẫn cần bộ nhớ rất lớn — đây là model quy mô datacenter, không phải hàng self-host tầm trung.
- Ai làm coding agent: tổ hợp CodeBuddy + cửa sổ 1 triệu token nhắm thẳng vào tác vụ phát triển ngữ cảnh dài — khu vực nhiều agent vẫn chật vật.
- Ai so sánh model: đừng vội tin số 2,99/4,00 — đó là đánh giá nội bộ. Chờ benchmark độc lập trước khi đưa vào quyết định chọn model.
- Ai theo xu hướng dài hạn: vòng lặp "model tự tối ưu chính nó" là tín hiệu đáng theo dõi hơn bất kỳ điểm benchmark nào trong thông báo này.
Điều cần biết
- Tencent mở mã nguồn Hy4 preview: 770 tỷ tham số tổng, 49 tỷ kích hoạt, cửa sổ ngữ cảnh hơn 1 triệu token.
- Định vị năng suất thực tế (coding, văn phòng, nghiên cứu), không phải chạy đua benchmark.
- Đánh giá mù nội bộ 2,99/4,00, nhỉnh hơn GLM-5.3 và Kimi K3 — là số liệu một phía từ Tencent.
- Model tự tối ưu hệ thống inference, tăng throughput 31,8%; cũng tham gia tối ưu chính quá trình huấn luyện.
- Miễn phí hai tuần trên WorkBuddy/CodeBuddy; API từ 0,834 USD mỗi triệu token đầu vào.
Điều đáng chú ý nhất ở Hy4 không phải là nó to hay rẻ, mà là câu chuyện nó đang bắt đầu kể: một model tham gia vào việc làm cho chính nó tốt hơn. Nếu hướng đi này được tái lập và kiểm chứng độc lập, nó sẽ quan trọng hơn bất kỳ bảng xếp hạng nào.
Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.
Related Posts
Nvidia mua Hugging Face 12,9 tỷ USD: khép kín đế chế chip
Nvidia mua Hugging Face 12,9 tỷ USD — từ chip đến kho model nguồn mở. Developer nên lo hay nên mừng?
Meta Muse Glimmer: Mô Hình Agent 30B Chạy Ngay Trên GPU Tiêu Dùng
Meta vừa phát hành Muse Glimmer, model 30B tham số tối ưu cho agent chạy local trên một GPU tiêu dùng — Apache 2.0, tốc độ 233 token/s trên RTX 5090.
Qwen 3.8 vs Kimi K3: Cuộc Đua Mô Hình AI Mở Của Trung Quốc Nóng Lên Từng Ngày
Chỉ trong 3 ngày, Alibaba và Moonshot AI lần lượt công bố Qwen 3.8 (2.4T tham số) và Kimi K3 (2.8T tham số) — cả hai đều mở trọng số. Cuộc đua đang định hình lại AI toàn cầu.