Skip to content

OpenAI Jalapeño: chip suy luận tự chế đánh bại Nvidia

Karify98 & Amy 🌸·
Cover Image for OpenAI Jalapeño: chip suy luận tự chế đánh bại Nvidia

OpenAI không còn chỉ viết model — họ vừa trình làng con chip suy luận đầu tiên của riêng mình, và nó thắng Nvidia ở đúng thế mạnh của Nvidia: hiệu năng trên watt. Jalapeño, con chip hợp tác cùng Broadcom, sinh nhiều token hơn trên mỗi đơn vị điện năng so với mọi hệ thống GPU mà SemiAnalysis từng đo.

Vài năm qua, OpenAI là khách hàng lớn nhất của Nvidia. Giờ họ tự làm phần cứng. Đó là một thay đổi chiến lược, không phải một sản phẩm phần cứng đơn lẻ.

Jalapeño là gì

Jalapeño được OpenAI gọi là "Intelligence Processor" — một chip inference thiết kế từ con số không cho mỗi tác vụ chạy LLM. Đây không phải GPU đa dụng được cải tiến, mà là một con chip chuyên phục vụ suy luận, do OpenAI thiết kế kiến trúc, Broadcom lo phần silicon và ASIC, Celestica lo sản xuất.

Chương trình được công bố lần đầu tháng 6/2026. Kết quả benchmark chính thức ra mắt tại hội nghị Hot Chips tháng 8. Tốc độ rất nhanh với một con chip đời đầu: OpenAI nói 9 tháng từ thiết kế đến sản xuất, còn SemiAnalysis ước tính khoảng 16 tháng từ lúc thành lập đội phần cứng đến khi tape-out. Dù theo mốc nào, đây đều là chu kỳ ngắn bất thường so với ngành chip truyền thống.

Về phần cứng, Jalapeño dùng bộ nhớ HBM4, định mức 700 watt nhưng công suất duy trì thực đo chỉ ở hoặc dưới 550 watt. Chi tiết này quan trọng: chip đời đầu thường phải đánh đổi hiệu năng lấy điện năng, nhưng Jalapeño đo được thấp hơn mức định danh.

Những con số benchmark

OpenAI đo Jalapeño trên bộ benchmark công khai InferenceX của SemiAnalysis, với ba model: GPT-OSS 120B, DeepSeek R1 670B và Kimi K2.5 1T. Kết quả so với các hệ thống dẫn đầu thị trường:

  • Hiệu năng trên watt cao hơn 1,5 đến 1,9 lần ở peak throughput.
  • Latency end-to-end thấp hơn 1,7 đến 3,6 lần.
  • Workload tương tác cao (agent, chat) đạt hiệu năng cao hơn 2,1 đến 4,1 lần.
  • Trên Kimi K2.5 1T — model công khai lớn nhất được test — hiệu năng trên watt cao hơn khoảng 1,5 lần và latency thấp hơn 3,4 lần.

SemiAnalysis, bên độc lập sở hữu benchmark này, còn mạnh miệng hơn: theo họ, Jalapeño thắng mọi chip Nvidia, AMD và Google mà họ từng đo. Đây là phát biểu của bên thứ ba, không phải OpenAI tự nhận, nhưng nó đáng chú ý vì SemiAnalysis vốn nổi tiếng khắt khe với phần cứng AI.

Vì sao nó thắng: full-stack codesign

Điểm mấu chốt nằm ở cách OpenAI thiết kế cả phần mềm lẫn phần cứng cùng lúc. Suy luận LLM có hai pha tắc nghẽn khác nhau: prefill nặng về tính toán, còn decode lại nghẽn ở băng thông bộ nhớ. Một hệ thống giỏi pha này có thể mất lợi thế khi chờ dữ liệu di chuyển giữa các lõi và chip.

Jalapeño giải quyết bằng cách giảm tối đa việc di chuyển dữ liệu. Trạng thái model, gồm cả KV cache dùng khi sinh câu trả lời, được đặt và giữ cục bộ, kích hoạt đúng tổ hợp tính toán, bộ nhớ và mạng cho từng pha. Mạng là một phần của kiến trúc, không phải thứ gắn thêm sau.

Còn một điểm dễ bị bỏ lỡ: Jalapeño là chip tổng quát, không chỉ chạy model của OpenAI. Nó chạy tốt GPT-OSS, DeepSeek và Kimi — ba model từ ba nguồn khác nhau. Điều này bác bỏ tin đồn "OpenAI chỉ tối ưu cho model riêng".

Ảnh hưởng gì tới developer

Đây là phần quan trọng nhất. Khi OpenAI tự làm chip inference, chi phí phục vụ mỗi request giảm xuống, và latency giảm theo. Hệ quả trực tiếp với developer:

  • API rẻ hơn, phản hồi nhanh hơn. OpenAI nói thẳng mục tiêu là "làm AI ngày càng rẻ và dễ tiếp cận hơn". Với ứng dụng agent — vốn cần chạy nhiều bước tuần tự và nhạy cảm với độ trễ tích lũy — đây là tin tốt.
  • Cuộc đua chip không còn là sân chơi riêng của Nvidia. Khi một khách hàng lớn nhất tự làm chip, áp lực cạnh tranh đổ lên toàn bộ chuỗi cung ứng GPU. Developer có thêm lựa chọn, dù gián tiếp.
  • Full-stack là rào cản mới. OpenAI giờ nắm model, sản phẩm, phần mềm serving, chip, bộ nhớ, mạng và hệ thống. Đối thủ chỉ làm một tầng sẽ khó theo kịp chu kỳ tối ưu liên tục này.

Về triển khai, Hock Tan của Broadcom xác nhận sẽ mở rộng lên quy mô gigawatt cùng Microsoft và các đối tác từ năm 2026. Đây không phải bản demo trong lab — engineering sample đã chạy model GPT-5.3-Codex-Spark ở tần số và công suất production.

Điều cần biết

  • Jalapeño là chip suy luận đầu tiên của OpenAI, hợp tác Broadcom và Celestica, dùng HBM4.
  • Benchmark InferenceX cho thấy hiệu năng trên watt cao hơn 1,5–1,9 lần, latency thấp hơn tới 3,6 lần so với hệ dẫn đầu.
  • SemiAnalysis đánh giá độc lập: thắng mọi chip Nvidia, AMD và Google họ từng đo.
  • Chiến lược full-stack giúp OpenAI tối ưu cả phần mềm lẫn phần cứng cùng lúc, giảm di chuyển dữ liệu.
  • Đây là nền tảng đa thế hệ, triển khai quy mô gigawatt từ 2026 — không phải sản phẩm một lần.

Câu hỏi còn lại không phải là Jalapeño có tốt hay không. Nó tốt. Câu hỏi là: khi nhà cung cấp model lớn nhất tự làm phần cứng, bao lâu nữa phần còn lại của ngành buộc phải làm theo?


Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts