Skip to content

GPT-5.6 Giảm 80% Giá Luna: Chiến Lược Giá Mới Của OpenAI

Karify98 & Amy 🌸·
Cover Image for GPT-5.6 Giảm 80% Giá Luna: Chiến Lược Giá Mới Của OpenAI

Ngày 30/7, OpenAI thông báo giảm giá mạnh hai model thuộc dòng GPT-5.6: Luna rẻ hơn 80%, Terra rẻ hơn 20%. Chỉ ba tuần sau khi ra mắt chính thức ngày 9/7, động thái này không phải khuyến mãi — nó báo hiệu cuộc đua giá AI đang tăng tốc vượt xa mọi dự đoán.

Chuyện gì đang xảy ra

Dòng GPT-5.6 gồm ba model: Sol (flagship), Terra (cân bằng), và Luna (tiết kiệm nhất). Khi ra mắt, giá gốc là:

Model Input (1M token) Output (1M token)
Sol $5.00 $30.00
Terra $2.00 $12.00
Luna $0.20 $1.20

Sau đợt giảm giá 30/7, Luna xuống còn $0.04 input / $0.24 output (giảm 80%), Terra xuống $1.60 input / $9.60 output (giảm 20%). Sol giữ nguyên giá nhưng có thêm chế độ Fast: nhanh gấp 2.5 lần với giá gấp đôi.

Để dễ hình dung: với Luna mới, 1 triệu token output có giá 24 cent — rẻ hơn một lon nước ngọt ở Sài Gòn.

Nhìn ra bức tranh cạnh tranh: Luna ở mức $0.04/$0.24 hiện rẻ hơn cả DeepSeek V4 Flash ($0.28/output) và Gemini 3.6 Flash ($1.50/$7.50). OpenAI đang dùng Luna để cạnh tranh trực tiếp ở phân khúc giá thấp — nơi trước đây họ gần như vắng mặt.

Một chi tiết đáng chú ý: OpenAI không tạo model mới để đạt được mức giá này. Họ dùng chính GPT-5.6 Sol để tối ưu code inference. Sol tự viết lại production kernel, giảm 20% end-to-end cost phục vụ model, đồng thời chạy hàng trăm thí nghiệm cải thiện hiệu suất sinh token thêm hơn 15%. Một vòng lặp khép kín: model tự cải thiện hiệu suất của chính nó, rồi lợi ích được chuyển thẳng cho khách hàng.

Vì sao giá giảm nhanh đến vậy

Thứ nhất, cạnh tranh đang ép giá xuống từ mọi phía. DeepSeek, Gemini Flash, Kimi K3 — mỗi model mới ra đều kéo mặt bằng giá xuống thấp hơn. OpenAI không thể neo giá cao khi đối thủ bán model chất lượng gần tương đương với giá thấp hơn một bậc. Luna là câu trả lời: một model đủ mạnh với giá đủ thấp để giữ chân khách hàng không chuyển sang đối thủ.

Thứ hai, inference đang rẻ đi nhanh hơn mọi dự đoán. OpenAI tuyên bố Luna hiện có hiệu năng tương đương model frontier-class cách đây một năm, nhưng chi phí chỉ bằng 6 cent trên mỗi đô la so với thời điểm đó. Cùng một chất lượng AI, giá giảm ~94% trong 12 tháng. Định luật Moore với chip mất 18-24 tháng để tăng gấp đôi mật độ transistor — AI inference đang vượt xa tốc độ đó.

Thứ ba, đây là chiến lược mở rộng thị trường. Để AI trở thành tiện ích hàng ngày như điện hay băng thông, giá phải đủ thấp để doanh nghiệp dùng hàng tỷ token mỗi ngày mà không cần cân nhắc. Luna ở mức $0.04/1M token input là bước đi có chủ đích để chiếm phân khúc volume cao, margin thấp — nơi quy mô sử dụng mới là lợi thế cạnh tranh thực sự.

Ảnh hưởng tới developer

1. Rào cản chi phí gần như biến mất

Với Luna ở mức giá mới, một ứng dụng chat xử lý 10,000 request/ngày, mỗi request ~2,000 token input + ~500 token output, sẽ tốn khoảng $2/ngày. Ở quy mô này, chi phí AI không còn là yếu tố cần cân nhắc khi quyết định build tính năng.

2. Kiến trúc "model routing" trở thành tiêu chuẩn

Bài toán không còn là "dùng model nào" mà là "dùng model nào cho task nào". Pattern phổ biến đang hình thành: Sol cho planning và quyết định phức tạp, Terra cho code reviewrefactor, Luna cho classification, testing, và các task lặp lại. Developer cần thiết kế pipeline có khả năng route task đến model phù hợp dựa trên độ phức tạp, thay vì dùng một model cho mọi thứ.

3. Fast mode mở ra use case real-time

Sol Fast mode (2.5x nhanh hơn, 2x giá) giải quyết bài toán latency cho ứng dụng cần phản hồi tức thì: chatbots, real-time coding assistants, autonomous agents cần vòng phản hồi nhanh. Đánh đổi: gấp đôi chi phí để giảm hơn nửa thời gian chờ. Với hệ thống production mà latency là ưu tiên hàng đầu, lựa chọn này rõ ràng.

4. Programmatic Tool Calling thay đổi cách gọi tool

GPT-5.6 có thể viết và chạy chương trình nhẹ để điều phối tool mà không cần developer script từng bước. Thay vì gửi từng tool response về model để xử lý, model tự lọc dữ liệu trung gian, giữ lại kết quả quan trọng, và quyết định bước tiếp theo — giảm đáng kể token và round-trip. Với agent workflow phức tạp (nhiều tool call), tính năng này cắt giảm chi phí và latency ở mức kiến trúc, không chỉ ở mức giá.

Những điều cần biết

  • Luna ở giá mới không phải model kém. Nó vượt qua Claude Fable 5 trên các benchmark chính với chi phí thấp hơn ~99%. Đừng đánh giá chất lượng qua giá — hãy chạy benchmark cho use case của bạn.
  • GPT-5.6 Sol tự tối ưu chính nó. Đây là lần đầu OpenAI công khai việc dùng model frontier để cải thiện inference pipeline — một cột mốc cho recursive self-improvement trong thực tế sản xuất.
  • Giá sẽ còn giảm nữa. Khoảng cách giá giữa model rẻ nhất và đắt nhất hiện là 643x (từ $0.28 đến $180/1M output token). Khi model giá rẻ ngày càng mạnh, phân khúc cao cấp buộc phải điều chỉnh. Thiết kế hệ thống với giả định chi phí AI tiếp tục giảm theo cấp số nhân.

Kết

Một năm trước, chạy agent AI với hàng triệu token mỗi ngày là bài toán chi phí nghiêm túc. Hôm nay, với Luna ở mức $0.04/1M token input, rào cản đó gần như biến mất. Cuộc đua không còn là ai có model mạnh nhất — mà là ai có thể đưa model đủ mạnh đến mức giá đủ thấp để trở thành hạ tầng.

Câu hỏi đáng suy nghĩ: nếu giá giảm 94% trong 12 tháng, developer build hệ thống hôm nay nên giả định gì về chi phí AI vào tháng 7/2027?


Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts