Skip to content

Ember-1: Fireworks cắt 40% token, giữ nguyên chất lượng Kimi K3

Karify98 & Amy 🌸·
Cover Image for Ember-1: Fireworks cắt 40% token, giữ nguyên chất lượng Kimi K3

Một model reasoning tốn tới 90% token chỉ để "nghĩ" trước khi trả lời — phần trả lời thật sự chỉ là phần nổi của tảng băng chi phí. Fireworks Research vừa ra mắt Ember-1, bản huấn luyện lại từ Kimi K3, cắt được 35-50% lượng token suy luận mà độ chính xác gần như đứng yên.

Vấn đề: reasoning model nghĩ quá nhiều

Các model reasoning kiểu Kimi K3 sinh ra một "chuỗi suy nghĩ" nội bộ trước khi đưa ra câu trả lời cuối. Vấn đề nằm ở chỗ trong các workload agentic — nơi model gọi tool, đọc kết quả, rồi suy luận tiếp qua nhiều lượt — toàn bộ chuỗi suy nghĩ của các lượt trước bị đọc lại (và tính phí lại) ở mỗi lượt sau. Context vì thế phình lên gần như bậc hai theo số lượt hội thoại.

Fireworks thử giải pháp đơn giản trước: hạ "reasoning effort" xuống thấp. Không ăn thua — chất lượng giảm mạnh hơn mức chấp nhận được. Vấn đề không phải là nghĩ ít đi, mà là nghĩ hiệu quả hơn. Đó là lý do họ quyết định huấn luyện lại model từ đầu.

Cách Fireworks huấn luyện Ember-1

Theo blog chính thức của Fireworks (công bố ngày 27/9/2026), đội Fireworks Research chạy hơn 50 thí nghiệm huấn luyện và hơn 200 lượt đánh giá, toàn bộ trên nền tảng Fireworks Serverless Training — không cần tự provision GPU, trả tiền theo lượt chạy thực tế.

Điểm mấu chốt: không phải mọi phần suy luận của K3 đều thừa. Một phần là tự phản tư (self-reflection) — xem lại giả định, phản ứng với feedback, truy ngược một kết quả về quyết định trước đó — và phần này giúp model tự sửa sai. Ember-1 được huấn luyện để giữ lại khả năng đó trong khi loại bỏ phần suy luận dư thừa, dựa trên dữ liệu trải rộng từ toán, coding, làm theo hướng dẫn, hội thoại, search, tool use tới software engineering.

Con số thật: benchmark và production

Fireworks công bố bảng so sánh Ember-1 với ba mức reasoning effort của K3 (low/high/max) trên 5 benchmark ngành:

Benchmark K3 max Ember-1 Chênh lệch chi phí
Terminal-Bench 2 80.9% 82.0% -51.9% token, -23.1 USD
SWE-bench Verified 93.2% 92.2% -15.5% token, -68.1 USD
SWE-Interact 21.3% 20.0% -32.5% token, -60.8 USD
DeepSWE 1.1 66.4% 75.2% -23.7% token, -126.9 USD
τ²-Bench Airline 64% 66% -5.9% token, -0.3 USD

Đáng chú ý, ở DeepSWE 1.1, Ember-1 không chỉ rẻ hơn mà còn cho điểm cao hơn K3 max — bằng chứng rằng cắt token thừa đôi khi giúp model tập trung hơn thay vì loanh quanh trong các nhánh suy luận vô ích.

Fireworks cũng chạy A/B test trực tiếp với hai khách hàng production trên workload coding thật. Kết quả: giảm khoảng 35% token mỗi task ở chất lượng tương đương, và các chỉ số downstream (tỷ lệ hoàn thành task, điểm thành công) đều giữ nguyên hoặc cải thiện. Một khách hàng đã chuyển hẳn Ember-1 vào production sau giai đoạn thử nghiệm, với kế hoạch thay thế hoàn toàn model gốc.

Nội bộ Fireworks còn thú vị hơn: họ âm thầm chuyển traffic coding nội bộ sang Ember-1 trước khi công bố ra ngoài. Developer không nhận ra gì khác biệt — với một model mà toàn bộ giá trị nằm ở "trả lời giống hệt, tốn ít token hơn", một cuộc chuyển đổi vô hình chính là tín hiệu tốt nhất.

Vậy điều này ảnh hưởng gì tới developer?

Nếu team bạn đang chạy agentic coding workload trên Kimi K3 hoặc model tương tự, chi phí token thường tăng phi tuyến khi task kéo dài nhiều lượt — chính vì hiện tượng "đọc lại reasoning cũ" ở trên. Ember-1 không phải phép màu, nhưng nó cho thấy một hướng đi rõ ràng: thay vì mua model to hơn hoặc giảm effort thô bạo, có thể huấn luyện lại để loại bỏ phần suy luận vô ích mà không đụng tới phần suy luận tạo ra giá trị thật.

Cần lưu ý vài điểm khi cân nhắc: Ember-1 hiện chỉ ở dạng "Research Preview" trên Fireworks Serverless — quyền truy cập miễn phí trong hai tuần, sau đó Fireworks sẽ quyết định có duy trì lâu dài hay không dựa trên nhu cầu cộng đồng. Đây không phải một model độc lập hoàn toàn tách khỏi Kimi K3 — nó vẫn dựa trên kiến trúc gốc, nên các giới hạn cố hữu của K3 (context window, khả năng đa ngôn ngữ...) vẫn giữ nguyên. Và các con số benchmark đến từ chính Fireworks, chưa có bên thứ ba độc lập kiểm chứng lại ở thời điểm bài viết.

Với các team đang tối ưu chi phí AI agent — đặc biệt là các tác vụ nhiều lượt như code review tự động hay debugging loop — đây là một model đáng thử trong hai tuần preview, trước khi quyết định có tích hợp lâu dài hay không.

Điều cần biết

  • Ember-1 = Kimi K3 huấn luyện lại để suy luận gọn hơn, không phải model hoàn toàn mới
  • Tiết kiệm 35-50% token, giữ chất lượng tương đương hoặc cao hơn trên phần lớn benchmark
  • Đang ở giai đoạn Research Preview miễn phí 2 tuần trên Fireworks Serverless
  • Benchmark do chính Fireworks công bố, chưa có kiểm chứng độc lập từ bên thứ ba
  • Phù hợp nhất với workload agentic nhiều lượt — nơi chi phí reasoning lặp lại tăng nhanh nhất

Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts