Skip to content

Etched Định Giá 10.3 Tỷ USD: Chip Suy Luận AI Thách Thức Nvidia

Karify98 & Amy 🌸·
Cover Image for Etched Định Giá 10.3 Tỷ USD: Chip Suy Luận AI Thách Thức Nvidia

Không Chỉ Là Một Vòng Gọi Vốn

Ngày 23/7, Etched — startup AI chip do ba cựu sinh viên Harvard thành lập năm 2022 — công bố gọi vốn 300 triệu USD Series C, định giá công ty ở mức 10.3 tỷ USD. Con số này gấp đôi mức định giá 5 tỷ hồi tháng 12/2025, chỉ sau 7 tháng. Đây cũng là mức định giá cao nhất từ trước đến nay cho một vòng Series C do Sequoia dẫn dắt.

Nhưng câu chuyện không dừng ở con số. Đây là tín hiệu cho thấy cuộc đua AI đang chuyển từ giai đoạn "ai huấn luyện được model to nhất" sang "ai chạy inference rẻ nhất." Và Nvidia, sau nhiều năm độc chiếm thị trường phần cứng AI, đang có thêm một đối thủ đáng gờm.

Etched Là Ai?

Etched được sáng lập bởi Gavin Uberti (CEO), Robert Wachen (COO) và Chris Zhu — bộ ba bỏ học Harvard để theo đuổi một ý tưởng bị nhiều người cho là điên rồ: thiết kế chip chỉ chạy inference cho mô hình transformer.

Sản phẩm đầu tay của họ là Sohu — một ASIC (Application-Specific Integrated Circuit) được tối ưu hóa riêng cho kiến trúc transformer, nền tảng đứng sau hầu hết mô hình AI hiện đại như ChatGPT, Claude, Gemini. Khác với GPU Nvidia — chip đa năng phải mang thêm nhiều tính năng không cần thiết cho AI — Sohu chỉ làm một việc: inference transformer. Và làm cực nhanh.

Điểm đáng chú ý: Etched không bán chip rời. Họ bán hệ thống hoàn chỉnh (rack systems), tương tự chiến lược DGX của Nvidia. Đây là nước đi thông minh — khách hàng doanh nghiệp không muốn tự lắp ráp hạ tầng AI.

Hai Con Chip, Hai Cách Tiếp Cận

Điều làm nên khác biệt nằm ở kiến trúc hai chip riêng biệt cho hai giai đoạn của inference:

Prefill (tiền xử lý): Giai đoạn model "đọc" prompt của người dùng, bao gồm toàn bộ ngữ cảnh. Bước này nặng về tính toán. Chip prefill của Etched chạy ở điện áp cực thấp — họ gọi là "low-voltage inference." Điện áp thấp = ít nhiệt hơn = nhồi được nhiều transistor hơn, dẫn đến mật độ FLOPs cao hơn đáng kể so với GPU truyền thống.

Decode (sinh token): Giai đoạn model tạo từng token đầu ra. Bước này cần ít tính toán hơn nhưng đòi hỏi băng thông bộ nhớ khổng lồ — vì mỗi token sinh ra đều phải truy cập toàn bộ tham số model. Etched phát triển công nghệ "cluster-scale memory" — bộ nhớ và interconnect mới cho phép nhiều chip chia sẻ một pool bộ nhớ chung với độ trễ cực thấp.

Kết hợp hai chip này, Etched tuyên bố đạt hiệu năng inference cao hơn gấp nhiều lần so với GPU Nvidia ở mức chi phí thấp hơn. Bên thứ ba ước tính Sohu có thể đạt hiệu suất gấp 10 lần cho inference model lớn.

Ai Đặt Cược Vào Etched?

Danh sách nhà đầu tư đọc như một "who's who" của giới công nghệ:

  • Sequoia dẫn đầu vòng Series C — mức định giá cao nhất họ từng lead một vòng C
  • Andreessen Horowitz (a16z), SK Hynix (nhà sản xuất HBM hàng đầu), Jane Street, Diffusion Capital cùng tham gia
  • Angel investor gồm Peter Thiel, Andrej Karpathy (Anthropic), Dylan Field (Figma), Amjad Masad (Replit)

Wachen tiết lộ cách họ thuyết phục những cái tên này: cho họ dùng thử phần cứng thật. "Andrej Karpathy, Noam Brown từ OpenAI, Geoffrey Hinton — tất cả đều đã trực tiếp thử nghiệm hệ thống và rất hào hứng." Không slide deck, không video demo — chỉ trình diễn phần cứng thực tế.

Họ cũng đã có đơn hàng trị giá 1 tỷ USD, theo thông báo hồi tháng 6. Hiện Etched có khoảng 400 nhân viên, vận hành trung tâm dữ liệu 2MW tại văn phòng chính San Jose, và vừa mở cơ sở mới rộng hơn 7,400 m² (80,000 sq ft), công suất 10MW tại Milpitas.

Không Chỉ Chạy Transformer

Một hiểu lầm phổ biến: Sohu chỉ chạy được một loại model. Thực tế, theo Wachen, hệ thống của Etched chạy được mọi mô hình AI hiện tại — bao gồm Mixture of Experts (DeepSeek, Qwen), thậm chí cả kiến trúc phi transformer như Mamba (state-space model). "Transformer-only" ở đây nghĩa là chip được tối ưu hóa cho transformer, không phải bị khóa cứng vào một model cụ thể.

Điều thú vị: ý tưởng "khắc" kiến trúc model vào silicon không còn bị coi là điên rồ. Google reportedly đang phát triển chip Frozen v2 với kiến trúc Gemini được in trực tiếp lên silicon. Nếu cả Google cũng đi theo hướng này, ASIC cho AI không phải là ngõ cụt.

Điều Này Có Ý Nghĩa Gì Với Developer?

Sự trỗi dậy của chip inference chuyên dụng mang đến ba hệ quả trực tiếp:

1. Chi phí API sẽ giảm mạnh

Inference chiếm phần lớn chi phí vận hành của các dịch vụ AI. Nếu chip chuyên dụng giảm được chi phí mỗi token xuống một bậc độ lớn, các nhà cung cấp API sẽ có dư địa để giảm giá. Điều này đặc biệt có lợi cho ứng dụng cần throughput cao: tìm kiếm ngữ nghĩa, chatbot chăm sóc khách hàng, code completion real-time.

2. Tự host model open-weight trở nên khả thi hơn

Với giá GPU Nvidia H100/B200 hiện tại, việc tự host một model như Llama hay DeepSeek ở quy mô production là bài toán kinh tế khó nhằn với phần lớn startup. Nếu Sohu hoặc chip tương tự giảm chi phí inference 5-10 lần, cán cân sẽ nghiêng về self-hosting — ít phụ thuộc vào API của Big Tech hơn.

3. Hệ sinh thái phần cứng đa dạng hơn

Độc quyền chưa bao giờ tốt cho developer. Một thị trường GPU AI chỉ có Nvidia đồng nghĩa với giá cao, thiếu hụt nguồn cung, và không có lựa chọn thay thế khi cần trade-off khác (latency thấp hơn vs throughput cao hơn). Sự xuất hiện của Etched, cùng Groq, Cerebras, d-Matrix, đang tạo ra một hệ sinh thái cạnh tranh — và developer là người hưởng lợi cuối cùng.

Còn Nhiều Thách Thức

Dù vậy, con đường phía trước không bằng phẳng:

  • Chưa có benchmark độc lập: Mọi số liệu hiệu năng hiện tại đến từ chính Etched hoặc đối tác được mời dùng thử. Cộng đồng kỹ thuật cần benchmark từ bên thứ ba để đánh giá khách quan.
  • Bài toán hệ sinh thái: Nvidia không chỉ bán chip — họ bán CUDA, nền tảng phần mềm đã thành tiêu chuẩn công nghiệp suốt hơn 15 năm. Để PyTorch, vLLM, TensorRT-LLM chạy mượt trên Sohu, Etched cần xây dựng software stack riêng — và thuyết phục cộng đồng áp dụng.
  • Sản xuất hàng loạt: TSMC đã sản xuất thành công lô chip đầu tiên, nhưng mở rộng quy mô sản xuất hàng loạt cho hàng nghìn hệ thống là thử thách hoàn toàn khác. Wachen thừa nhận: "Tôi nghĩ chúng tôi vẫn phải khiêm tốn về những gì cần làm để đạt được quy mô thực sự."

Takeaways

  • Etched gọi vốn 300 triệu USD Series C ở định giá 10.3 tỷ, gấp đôi sau 7 tháng — mức cao nhất từ trước đến nay cho Series C do Sequoia dẫn dắt
  • Sohu là ASIC chuyên inference transformer, dùng kiến trúc hai chip (low-voltage prefill + cluster-scale memory decode) để đạt hiệu năng gấp nhiều lần GPU Nvidia
  • Đã có 1 tỷ USD đơn hàng, TSMC sản xuất thành công lô chip đầu, hệ thống đang được khách hàng thử nghiệm
  • Tác động tới developer: chi phí inference giảm → API rẻ hơn, tự host open-weight model khả thi, bớt phụ thuộc Nvidia
  • Thách thức: thiếu benchmark độc lập, cần software stack cạnh tranh với CUDA, mở rộng quy mô sản xuất hàng loạt

Cuộc đua AI đang bước vào giai đoạn mà chi phí inference — không phải training — mới là yếu tố quyết định. Nếu Etched và các công ty chip chuyên dụng giữ được lời hứa về hiệu năng, thị trường phần cứng AI sẽ thay đổi căn bản trong 2-3 năm tới. Còn nếu không, 300 triệu USD này sẽ chỉ là một footnote trong lịch sử những startup dám thách thức Nvidia.

Dù kết quả thế nào, developer là bên được lợi. Cạnh tranh trong lĩnh vực phần cứng đồng nghĩa với inference rẻ hơn, nhanh hơn, và nhiều lựa chọn hơn.


Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts