Skip to content

MiniMax H3: Mô Hình Video Đa Phương Thức Mở, Giá Rẻ Hơn 3 Lần

Karify98 & Amy 🌸·
Cover Image for MiniMax H3: Mô Hình Video Đa Phương Thức Mở, Giá Rẻ Hơn 3 Lần

Mở bài

Ngày 31/7/2026, MiniMax — công ty AI Thượng Hải được định giá khoảng 4 tỷ USD — chính thức ra mắt H3, thế hệ thứ ba trong dòng mô hình video Hailuo. Ba điểm đáng chú ý: đây là mô hình video đa phương thức đầu tiên được công bố với kế hoạch mở trọng số. Giá API chỉ bằng một phần ba đối thủ ở cùng phân khúc chất lượng, và ComfyUI đã có hỗ trợ native ngay trong ngày ra mắt.

Không giống các bản Hailuo trước — vốn chỉ nhận prompt văn bản hoặc một ảnh đơn — H3 tiếp nhận đồng thời văn bản, ảnh, video và audio, rồi xuất ra video 2K kèm âm thanh stereo trong cùng một lần sinh. Không cần tầng upscale riêng, không cần ghép audio hậu kỳ. Một lần gọi API, một kết quả.

H3 là gì — không chỉ là "mô hình video"

Điểm khác biệt lớn nhất giữa H3 và các mô hình video hiện tại nằm ở cách nó xử lý input đa phương thức. H3 không tách riêng text-to-video, image-to-video, hay audio-to-video thành các pipeline riêng biệt. Thay vào đó, mọi input được đưa vào cùng một transformer và xử lý như một ngữ cảnh thống nhất — tối đa 9 ảnh tham chiếu, 3 video clip, và 3 audio clip.

Điều này mở ra khả năng mới cho các tác vụ sáng tạo phức tạp. Ví dụ từ bài blog chính thức: "Tham chiếu chuyển động camera Hitchcock từ Video 1, để nhân vật trong Ảnh 2 hát, giọng khớp với Audio 3." Một câu prompt mô tả mối quan hệ giữa các input, và H3 tự xử lý toàn bộ logic cross-modal.

Với developer, hàm ý rất rõ: API video generation không còn là một pipeline gồm nhiều bước rời rạc. Thay vì gọi riêng T2V → upscale → ghép audio, tất cả gộp vào một endpoint duy nhất. Độ phức tạp tích hợp giảm đáng kể, thời gian phát triển tính năng rút ngắn theo.

Giá: logic so sánh cần rõ ràng

Mức giá API công bố của H3 là $0.13/giây cho video 2K native. Các đối thủ chính: Kling (Kuaishou) ~$0.07/giây cho 1080p, Sora (OpenAI) ~$0.10/giây cho 1080p, Veo 3 (Google) lên tới $0.40/giây cho 4K. Nhìn qua, Sora có vẻ rẻ hơn H3 về giá thô ($0.10 vs $0.13). Nhưng đây là so sánh sai — Sora xuất 1080p, không có audio. H3 xuất 2K native kèm stereo audio.

Con số "rẻ hơn 3 lần" đến từ chính MiniMax: họ tuyên bố giá mỗi giây video 2K của H3 thấp hơn 1/3 so với các mô hình chính thống khi chuẩn hóa về cùng mức chất lượng. Dù không nêu tên đối thủ cụ thể, dữ liệu thị trường hỗ trợ hướng của tuyên bố này. Một video quảng cáo 15 giây ở 2K với H3 tốn $1.95. Để đạt chất lượng tương đương với Sora (1080p + upscale + audio riêng), chi phí tổng dễ vượt $4-5.

Nói cách khác: H3 không phải là lựa chọn rẻ nhất về giá thô. Nhưng nếu tính trên mỗi đơn vị chất lượng đầu ra (độ phân giải + audio), khoảng cách chi phí là thật.

Mở trọng số — nhưng chưa có weights

H3 được quảng bá là "open-weight", nhưng tính đến ngày 1/8/2026 — một ngày sau khi ra mắt — trọng số vẫn chưa được phát hành. MiniMax hứa sẽ công bố "trong vài ngày tới, tuỳ thuộc vào quy định pháp lý." License dự kiến là MiniMax Community License: cho phép sử dụng thương mại với tổ chức có doanh thu dưới 20 triệu USD, yêu cầu ghi công.

Đây là một pattern quen thuộc trong làng AI Trung Quốc: công bố "mở" trước, phát hành weights sau. DeepSeek, Qwen, Kimi đều từng làm vậy. Không hẳn là dấu hiệu xấu — MiniMax đã có lịch sử phát hành model M-series dạng mở — nhưng developer nên thận trọng trước khi build production pipeline phụ thuộc vào weights chưa tồn tại.

Một tín hiệu tích cực: MiniMax cho biết khả năng tương thích phần cứng đã được cân nhắc từ giai đoạn thiết kế đầu tiên của H3, bao gồm cả chip Trung Quốc sản xuất. Đây không phải là model được huấn luyện trên một cụm GPU cụ thể rồi "port" sau — ý định self-hosting đã nằm trong kiến trúc ngay từ đầu.

ComfyUI hỗ trợ Day-0 — chạy được trên RTX 3060

Cùng ngày ra mắt, ComfyUI phát hành bản 0.30.0 với hỗ trợ native cho H3. Một cột mốc quan trọng: thông thường, mô hình video mới mất vài tuần đến vài tháng để có integration ổn định trong các công cụ open-source.

Đội ngũ ComfyUI đã thực hiện ba tối ưu hóa then chốt để đưa H3 về consumer hardware:

  • Pruning modulation weights: Khoảng 40% tham số của H3 là modulation weights — các trọng số điều chỉnh hành vi model theo input. Nhóm ComfyUI phát hiện có thể thay thế phần này bằng một bảng tra cứu tương đương về mặt chức năng, cắt giảm memory footprint đáng kể mà không giảm chất lượng đầu ra.
  • INT8 quantization với convrot: Quantization tùy chỉnh cho các tầng convolution, giữ độ chính xác cao hơn so với int8 tuyến tính thông thường.
  • Dynamic VRAM offloading: Tự động chuyển các phần của model giữa GPU RAM và system RAM trong quá trình inference.

Kết quả: memory footprint giảm 66% — từ 123.6GB (full precision) xuống còn 42.5GB. Kết hợp với offloading, H3 có thể chạy trên một GPU RTX 3060 (12GB VRAM). Một mô hình video 2K đa phương thức chạy được trên GPU tầm trung — điều mà cách đây 6 tháng không ai nghĩ là khả thi.

Kiến trúc kỹ thuật: bốn trụ cột

Dù MiniMax chưa công bố technical report đầy đủ, bài blog giới thiệu mô tả bốn công nghệ lõi. Điểm chung: tất cả đều xoay quanh việc giảm chi phí inference mà không hy sinh chất lượng.

Contextual Omni Representation — hệ thống captioning đa phương thức, chuyển đổi input phức tạp (ảnh, video, audio) thành biểu diễn ngôn ngữ nén. Mỗi sample cần ~100K token inference, được chưng cất xuống trung bình ~4K token. Ngôn ngữ đóng vai trò "cầu nối" giữa ngữ cảnh đầu vào và video mục tiêu, cho phép mô tả mối quan hệ cross-modal bằng ngôn ngữ tự nhiên thay vì tham số kỹ thuật. Với developer, điều này có nghĩa là prompt dạng "để nhân vật A di chuyển như video B, giọng nói từ audio C" sẽ hoạt động — không cần tách thành nhiều bước riêng.

H3-VAE — bộ tokenizer thiết kế lại, đạt tỉ lệ nén gấp 4 lần so với Hailuo 02. Hệ quả trực tiếp: chi phí training và inference giảm, đồng thời cho phép xuất 2K nguyên bản không cần super-resolution. Đây là một trong những lý do H3 có giá rẻ hơn đối thủ dù chất lượng cao hơn.

H3-Omni Transformer — kiến trúc training tách biệt phần understanding và generation compute. Ngữ cảnh đa phương thức khiến độ dài sequence dao động gấp 3 lần; việc tách này giúp tăng throughput training gần 30%.

In-Context Regeneration — thay vì dùng module super-resolution riêng để nâng cấp từ low-res lên 2K, H3 tái sinh chính output độ phân giải thấp trong ngữ cảnh. Cách tiếp cận này khôi phục chi tiết nhỏ (chữ, logo thương hiệu) mà SR truyền thống "chỉ có thể đoán." Đây là lý do H3 mạnh về text rendering và brand marks — điểm yếu cố hữu của hầu hết mô hình video hiện tại.

Điểm chính cho developer

  • API đơn giản hơn: Một endpoint duy nhất xử lý text + ảnh + video + audio → video + stereo audio. Không còn pipeline 4-5 bước.
  • Giá cạnh tranh cho chất lượng cao: $0.13/giây cho 2K native kèm audio. Sora rẻ hơn về giá thô nhưng chất lượng thấp hơn và không có âm thanh — so sánh công bằng thì H3 đang dẫn trước về cost-per-quality.
  • Open weights sắp tới — nhưng chưa có: Tạm thời vẫn phải dùng API nếu muốn tích hợp ngay. Chưa nên lên kế hoạch production self-hosted dựa trên weights chưa phát hành.
  • ComfyUI ready: Có thể thử nghiệm local ngay trên RTX 3060. Workflow có sẵn trên ComfyUI template library — tải về, tải model, chạy.
  • Không phải mô hình tổng quát: H3 là mô hình sinh video chuyên biệt — không thay thế LLM. Giải quyết một bài toán hẹp nhưng làm rất tốt.

Kết luận

H3 đánh dấu một bước chuyển đáng kể trong lĩnh vực video generation: đa phương thức thực sự, giá trên mỗi đơn vị chất lượng thấp hơn hẳn, và — nếu lời hứa open-weight thành hiện thực — sẽ là mô hình video frontier đầu tiên thực sự mở. Việc ComfyUI có Day-0 support và tối ưu chạy được trên RTX 3060 cho thấy hệ sinh thái open-source đã sẵn sàng.

Nhưng vẫn còn một câu hỏi: đến khi nào weights thực sự được phát hành? Trong lịch sử AI Trung Quốc gần đây, khoảng cách giữa "công bố mở" và "code lên Hugging Face" dao động từ vài ngày (DeepSeek) đến vài tuần (Qwen). Với MiniMax, câu trả lời vẫn đang chờ.

Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts