GitHub Copilot ra mắt HydraFusion, giảm 67% chi phí

GitHub vừa công bố Project HydraFusion — một cách chọn model hoàn toàn khác. Thay vì để người dùng tự chọn Claude, GPT hay Gemini cho mỗi tác vụ, HydraFusion tự dựng cả một quy trình phối hợp nhiều model để giải quyết yêu cầu. Theo benchmark nội bộ của GitHub, chất lượng ngang Opus 5 trong khi chi phí thấp hơn tới 67%.
Vấn đề mà auto model selection chưa giải quyết được
Đầu năm 2026, GitHub Copilot ra mắt Auto model selection — tính năng phân tích tác vụ rồi gợi ý model phù hợp nhất. Nó giải quyết được bài toán "chọn model nào", nhưng vẫn dừng lại ở việc gán một model duy nhất cho một request. Vấn đề là nhiều tác vụ coding không cần một model mạnh xử lý từ đầu đến cuối — chúng cần một quy trình: bản nháp nhanh, sau đó review, rồi mới quyết định có cần escalate lên model mạnh hơn hay không.
Đó chính là cách developer vẫn làm thủ công: nhờ một model draft, đưa cho model khác review, và chỉ gọi tới model đắt tiền khi thực sự bí. HydraFusion đưa quy trình này vào runtime, tự động hóa toàn bộ.
Ba kiểu workflow, một model ảo
Khi chọn HydraFusion trong danh sách model, GitHub sẽ tự quyết định dùng một trong ba pattern:
- Single — một model xử lý trực tiếp, dùng khi tác vụ đơn giản không cần thêm bước nào
- Cascade — một model nhẹ soạn bản nháp trước, quality gate quyết định chấp nhận hay đẩy lên model mạnh hơn
- Critique — một model soạn kết quả, một model khác (từ một provider khác) đóng vai critic đọc-không-sửa để review, model gốc sửa lại một lần theo phản hồi đó
Điểm đáng chú ý: bước critique chạy trong context cách ly, không có quyền truy cập tool hay workspace. Model review chỉ đọc và nhận xét, không thể tự ý sửa code. Thiết kế này tránh tình trạng hai model "cãi nhau" vô tận trên cùng một repo.
HydraFusion coi việc chọn workflow là bài toán tối ưu, dựa vào tín hiệu về khả năng reasoning, code generation, debugging và tool use của từng request để chọn pattern ít tốn kém nhất mà vẫn đạt ngưỡng chất lượng cần thiết. Nói cách khác, tác vụ càng đơn giản, quy trình càng ngắn — không phải cứ dùng HydraFusion là tốn thêm tiền.
Số liệu benchmark: được gì, mất gì
GitHub công bố kết quả trên ba benchmark, so với baseline Claude Opus 5 và GPT-5.6 Sol, cùng điều kiện input, tool, giới hạn thực thi và cách tính giá:
| Benchmark | Chi phí so với Opus 5 | Chất lượng so với Opus 5 |
|---|---|---|
| TerminalBench 2.1 | Thấp hơn 67% | Cao hơn 4.9 điểm % |
| DeepSWE | Thấp hơn 36% | Thấp hơn 1.5 điểm % |
| CheckpointBench (nội bộ) | Thấp hơn 65% | Thấp hơn 0.1 điểm % |
TerminalBench 2.1 là kết quả ấn tượng nhất — vừa rẻ hơn vừa tốt hơn Opus 5. Nhưng DeepSWE, benchmark đánh giá các tác vụ engineering phức tạp trên nhiều file, cho thấy HydraFusion vẫn thua Opus 5 gần 1.5 điểm phần trăm, dù bù lại bằng chi phí thấp hơn hẳn. Đây là điểm cần lưu ý: HydraFusion tối ưu cho tỷ lệ chất lượng/chi phí, không phải để đánh bại model đơn lẻ mạnh nhất trong mọi trường hợp.
CheckpointBench — bộ benchmark GitHub tự dựng từ các phiên làm việc thật của người dùng Copilot, neo vào commit cụ thể để có thể chạy lại — cho kết quả gần như ngang Opus 5 (chênh 0.1 điểm %) với chi phí thấp hơn 65%. Đây có lẽ là con số phản ánh sát nhất trải nghiệm thực tế, vì nó dựa trên workload thật thay vì benchmark học thuật.
Điều cần biết
- Research preview, chưa phải sản phẩm chính thức — số liệu và hành vi có thể thay đổi
- Tốt nhất cho tác vụ single-prompt — chưa tối ưu cho phiên làm việc dài, nhiều lượt
- Fail-safe: workflow lỗi hoặc bị hủy → không patch nào được áp, tránh thay đổi dở dang trong repo
- Tiết kiệm chi phí đến từ routing thông minh, không phải từ model rẻ hơn — team tự build agent có thể học theo cách làm này dù không dùng Copilot
Vì sao đáng theo dõi
Cuộc đua model đơn lẻ (model nào mạnh nhất) đang dần chuyển sang cuộc đua orchestration (phối hợp model nào hiệu quả nhất). HydraFusion không phải công ty đầu tiên thử ý tưởng này, nhưng là lần đầu một nền tảng coding agent lớn đưa nó vào production research preview với benchmark công khai. Nếu quy trình cascade/critique thực sự giữ được chất lượng ở workload thật — không chỉ trên benchmark đã được GitHub tối ưu ngược lại trong quá trình phát triển — đây có thể là hướng đi mặc định cho coding agent trong 1-2 năm tới, thay vì tiếp tục chạy đua chọn "model tốt nhất" cho từng request.
Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.
Related Posts
GPT-5.6: OpenAI Vượt Claude Với Model Coding Nhanh Gấp Đôi, Rẻ Hơn 27%
GPT-5.6 Sol đạt 80 điểm Coding Agent Index, vượt Fable 5 với thời gian chỉ bằng một nửa. Ba model Sol/Terra/Luna ra mắt 9/7, có case study thực tế từ production xác nhận.
GitHub Copilot Đổi Cách Tính Phí: Khi AI Agent 'Ngốn' Quá Nhiều Tiền
Từ 1/6/2026, GitHub Copilot chính thức chuyển sang mô hình usage-based dùng AI Credits. Đây có phải dấu chấm hết cho kỷ nguyên AI giá rẻ?
Đánh Giá AI Coding Agent: SWE-bench Và Các Benchmark 2026
SWE-bench, HumanEval, TerminalBench — developer cần biết gì về cách đánh giá AI coding agent trong 2026?