DeepSeek V4 Pro Chính Thức: Mở Mã Nguồn Harness, Tăng Giá API

DeepSeek vừa làm một nước đi hiếm thấy giữa cuộc đua giảm giá AI: mở mã nguồn công cụ agent của mình, rồi đồng thời tăng giá API. Ngày 13/8, hãng chính thức đưa DeepSeek V4 Pro (build 0813) ra khỏi giai đoạn thử nghiệm, phát hành Harness v0.1 — một agent harness mã nguồn mở theo giấy phép MIT — và công bố biểu giá peak/off-peak mới có hiệu lực từ 16/8.
Ba động thái trong cùng một thông báo. Với developer đang dùng DeepSeek, cả ba đều tác động trực tiếp.
V4 Pro: Bản Nâng Cấp Nhắm Thẳng Vào Agent
Tên model, số tham số và context window 1 triệu token giữ nguyên — các tích hợp hiện có không cần chỉnh. Thứ thay đổi là bộ não bên trong, nhắm vào khối lượng công việc agent: debug, tự sửa lỗi, gọi tool nhiều bước.
Theo bảng so sánh do chính DeepSeek công bố, điểm Terminal Bench 2.1 nhảy từ 72.1 lên 87.9, còn DeepSWE tăng từ 12.8 lên 62.7. Trên một số benchmark agent, V4 Pro 0813 vượt qua Claude Opus 4.8. Cần lưu ý đây là số liệu tự đo của DeepSeek — vendor nào cũng chọn benchmark có lợi cho mình.
Số liệu độc lập từ Artificial Analysis dè dặt hơn: chỉ số Intelligence Index của V4 Pro tăng từ 45 lên 53, ngang với GLM-5.2, nhưng vẫn đứng sau Muse Spark (57), Qwen 3.8 Max (58), Kimi K3 (60) và Claude Opus 5 (63). Tức là bản nâng cấp có thật, nhưng chưa đưa V4 Pro lên nhóm dẫn đầu. Đáng chú ý, trọng số (weights) của build 0813 chưa được công bố — bản preview tháng 4 vẫn nằm trên Hugging Face.
Thêm một chi tiết đáng giá cho agent: V4 Pro giờ hỗ trợ native OpenAI Responses API kèm tích hợp Codex, với ba mức reasoning effort — low, high, max. DeepSeek khuyến nghị mức "high" cho tác vụ agent hằng ngày.
Harness: "Mọi Thứ Đều Là Plugin"
Harness v0.1 (lệnh dsh) là phần thú vị hơn cả với developer. Đây là agent harness mã nguồn mở, được định vị như lựa chọn thay thế Claude Code hay Codex — nhưng khác ở chỗ kiến trúc mở đến tận gốc.
Nguyên tắc cốt lõi của Harness là "everything is a plugin": model, tool, skill, session, sandbox, filesystem, loop, orchestration và cả giao diện đều là plugin có thể thay thế. Nền tảng của nó là Cordis, một framework plugin composable mới ra mắt. Khác với Claude Code — nơi các thành phần này bị khóa vào một sản phẩm — Harness để bạn tháo lắp từng lớp.
Điểm khác biệt thứ hai là session log liên tục: mỗi prompt, mỗi tool call, mỗi kết quả đều được ghi lại, và một lần chạy có thể resume, branch hoặc replay. Với việc debug agent — vốn nổi tiếng khó tái hiện — đây là thứ giúp ích thật sự.
Khả năng hiện tại đã đủ để chạy một coding agent thực thụ: đọc repo, sửa file, chạy shell, tìm kiếm, lập kế hoạch, giao việc cho subagent và kiểm soát quyền. DeepSeek cảnh báo thẳng đây là Developer Preview — "THERE WILL BE COMPATIBILITY-BREAKING CHANGES" — nên chưa phải thứ để đưa vào production ngay. Dự án do Cui Tianyi dẫn dắt, người gia nhập DeepSeek từ quỹ định lượng Jane Street hồi tháng 3/2026. Lời kêu gọi beta tester đầu tháng 8 thu hút 712 dự án chỉ trong ba ngày.
Giá Tăng: Cache Hit Là Điểm Đau
Trong khi phần còn lại của ngành đang đua giảm giá, DeepSeek đi ngược lại — và mức tăng mạnh nhất rơi đúng vào cache hit.
Từ 16/8 lúc 16:00 UTC, DeepSeek bỏ giá cố định, chuyển sang peak/off-peak. Giờ off-peak (ngoài khung 1–4h và 6–10h UTC), input tăng từ $0.435 lên $0.66 mỗi triệu token, output từ $0.87 lên $1.98. Giờ peak, con số gấp đôi: $1.32 input, $3.96 output.
Cú đánh nặng nhất là cache hit: từ $0.003625 lên $0.022 (off-peak) và $0.044 (peak) — tức gấp 6 đến 12 lần. Mức chiết khấu cache theo đó thu hẹp từ 1/120 xuống còn 1/30 giá input thường. Với agent liên tục đọc lại cùng một bộ file, đây chính là khoản chi phí phình lên nhanh nhất.
Động thái này đảo ngược một phần đợt giảm giá mà DeepSeek tung ra hồi tháng 5 — và theo The Decoder, nó diễn ra khi công ty đang huy động thêm vốn.
Điều Này Có Ý Nghĩa Gì Với Developer?
Nếu bạn đang chạy agent trên API DeepSeek: tính lại chi phí trước 16/8. Đặc biệt là workload phụ thuộc cache hit — prompt cache vốn là cách tiết kiệm chi phí cho agent đọc lại file nhiều lần. Mức tăng 6–12x có thể làm đảo lộn bài toán kinh tế.
Nếu bạn muốn tự kiểm soát agent layer: Harness đáng để thử, nhất là khi bạn cần thay model (DeepSeek, Anthropic, OpenAI hoặc endpoint tùy chỉnh) hoặc muốn session log đầy đủ để debug. Đổi lại, nó còn non, chưa có PR workflow kiểu GitHub-native hay hosted background agent như Claude Code.
Nếu bạn chỉ quan tâm model: V4 Pro 0813 mạnh hơn thật, nhưng theo số liệu độc lập thì vẫn ở nhóm giữa. Đừng kỳ vọng nó vượt mặt Claude Opus 5.
Tín hiệu lớn hơn nằm ở chỗ DeepSeek không còn chỉ cạnh tranh bằng giá model. Với Harness, hãng tiến vào lớp phần mềm quyết định cách model dùng tool, thao tác file và chạy workflow dài — chính là sân chơi mà Claude Code đang thống trị.
Những Điều Cần Biết
- V4 Pro build 0813 ra mắt chính thức 13/8; tên, tham số và context 1M token giữ nguyên.
- Terminal Bench 2.1 tăng 72.1 → 87.9; DeepSWE tăng 12.8 → 62.7 (số liệu DeepSeek tự công bố).
- Artificial Analysis: Intelligence Index 45 → 53, ngang GLM-5.2, sau Kimi K3 và Claude Opus 5.
- Harness v0.1 mã nguồn mở (MIT), kiến trúc "everything is a plugin", chạy bằng
npx @deepseek-ai/dsh web. - Giá mới từ 16/8 16:00 UTC: peak/off-peak; cache hit tăng 6–12 lần.
- Cài đặt:
npx @deepseek-ai/dsh web(Developer Preview).
Cùng một ngày, DeepSeek vừa trao cho cộng đồng một công cụ agent mã nguồn mở, vừa khiến việc dùng model của họ đắt hơn. Hai động thái nhìn có vẻ mâu thuẫn, thực ra cùng một chiến lược: chuyển cuộc chơi từ "rẻ nhất" sang "kiểm soát toàn bộ vòng lặp agent". Câu hỏi còn lại là developer sẵn sàng trả bao nhiêu cho lớp phần mềm đó — và liệu Harness non trẻ có đủ sức giữ chân họ khi giá tăng.
Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.
Related Posts
Meta Muse Glimmer: Mô Hình Agent 30B Chạy Ngay Trên GPU Tiêu Dùng
Meta vừa phát hành Muse Glimmer, model 30B tham số tối ưu cho agent chạy local trên một GPU tiêu dùng — Apache 2.0, tốc độ 233 token/s trên RTX 5090.
Gemini 3.6 Flash: Ít Token Hơn, Rẻ Hơn, Tốt Hơn Cho AI Agent
Google ra mắt Gemini 3.6 Flash — dùng ít token hơn 17% so với 3.5 Flash, giá rẻ hơn, điểm benchmark cao hơn. Flash-Lite đạt 350 token/s chỉ $0.3/1M input, tối ưu cho agentic workflow quy mô lớn.
DeepSeek DSpark: Tăng Tốc Độ Sinh Token 85% Nhờ Speculative Decoding
DeepSeek vừa mở mã nguồn DSpark — hệ thống speculative decoding tăng tốc độ sinh token lên tới 85% trên V4-Flash mà không cần thêm GPU.