Skip to content

GigaToken: Tokenizer Nhanh Gấp 1000 Lần — Điều Developer Cần Biết

Karify98 & Amy 🌸·
Cover Image for GigaToken: Tokenizer Nhanh Gấp 1000 Lần — Điều Developer Cần Biết

24.53 GB/s. Đó là tốc độ tokenize văn bản của GigaToken — một dự án Rust xuất hiện trên Hacker News ngày 22/07/2026 và lập tức gây bão với 279 điểm, 51 bình luận.

Để có context: HuggingFace tokenizers và tiktoken của OpenAI — vốn đã là Rust multithreaded, đã được tối ưu nhiều năm — tokenize cùng một file ở tốc độ 25-36 MB/s. GigaToken nhanh gấp ~1000 lần HuggingFace, ~700 lần tiktoken. Không phải trên một benchmark đơn lẻ — trên hơn 20 bộ tokenizer, trên cả AMD EPYC, Apple M4 Max lẫn Ryzen consumer.

Không Phải "Nhanh Hơn Một Chút" — Là Nhanh Hơn Cả Trật Tự

Khi HuggingFace tokenizers đo bằng MB/s và GigaToken đo bằng GB/s, "nhanh hơn" không còn là từ phù hợp. Đây là sự thay đổi về đơn vị đo:

Tokenizer GigaToken HF tokenizers tiktoken vs HF vs tiktoken
GPT-2 24.53 GB/s 24.8 MB/s 36.0 MB/s 989× 681×
Qwen 3 22.16 GB/s 34.2 MB/s 648×
DeepSeek V4 19.69 GB/s 26.2 MB/s 750×
Llama 4 20.77 GB/s 72.7 MB/s 286×

Trên AMD EPYC 9565 (144 nhân). Trên Apple M4 Max (16 nhân), GPT-2 tokenizer đạt 8.79 GB/s — gấp 1,268× HF.

Tác giả Marcel Rød giải thích kỹ thuật trên HN: thay regex engine (vốn xử lý pretokenization) bằng SIMD, tối ưu cache cho pretoken mapping, giảm rẽ nhánh, và hạn chế tương tác giữa Python và thread. Cache là phần khó nhất: phân phối pretoken có đuôi rất dài — vài từ xuất hiện hàng triệu lần, phần lớn chỉ vài lần. Cache cho phân phối kiểu này là bài toán không tầm thường.

Tokenization Chỉ <0.1% Thời Gian Inference. Vậy Sao Phải Quan Tâm?

Câu hỏi đầu tiên trên HN — và xứng đáng có câu trả lời tử tế.

Training data pipeline. Tokenize 1 TB văn bản ở 25 MB/s mất ~11 giờ. Ở 24.53 GB/s: ~41 giây. Với team ML đang liên tục thử nghiệm dataset, thời gian chờ từ "gần nửa ngày" xuống "dưới một phút" thay đổi hoàn toàn vòng lặp phát triển.

Inference routing. Người vận hành nền tảng AI trên HN xác nhận: họ tokenize sớm để quyết định routing và rate limiting trước khi request đến GPU. Tokenizer nằm trên critical path — mỗi mili giây nhân lên hàng triệu request mỗi ngày.

Time-to-first-token (TTFT). Với model nhỏ, tokenization có thể chiếm phần đáng kể trong TTFT. Với inference provider chuyên latency thấp (Groq, Cerebras), mỗi micro-giây đều có giá.

Câu hỏi thú vị nhất. Nếu tokenization — thứ được coi là "đã tối ưu đủ" — còn room 1000x, còn bao nhiêu thành phần khác trong inference pipeline cũng để ngỏ cơ hội tương tự?

Dùng Như Thế Nào

Cài qua pip. Hai chế độ:

import gigatoken as gt

# Chế độ tương thích HuggingFace — đổi 1 dòng
tokenizer = gt.Tokenizer(hf_tokenizer).as_hf()
tokens = tokenizer.encode_batch(["Đây là văn bản test", "Và đây là cái khác"])

# Chế độ native — hiệu năng tối đa, bỏ qua Python overhead
tokenizer = gt.Tokenizer("Qwen/Qwen3-8B")
file_source = gt.TextFileSource(["data.txt"], separator=b"[REMOVED_SPECIAL_TOKEN]")
tokens = tokenizer.encode_files(file_source)

Output khớp token-by-token với HuggingFace. Hỗ trợ 20+ tokenizer: GPT-2, Llama 3/4, Qwen 2/3/3.6, DeepSeek V3/R1/V4, Phi-4, OLMo 2/3, Gemma 3/4, GLM 4/5, Kimi K2, Mistral 7B, và nhiều cái khác.

Góc Nhìn

Có một nghịch lý đáng suy nghĩ. Ngành AI đang đổ hàng trăm tỷ đô vào GPU, kiến trúc model mới, scaling law — những thứ hứa hẹn cải thiện 10-20%. Trong khi đó, một kỹ sư với Rust và SIMD tìm ra cách tăng tốc 100.000% cho một thành phần "đã được tối ưu."

Pattern này lặp lại. Năm 2023, MLC-LLM dùng compilation thông minh để tăng tốc inference Llama trên laptop lên gấp nhiều lần. Năm 2024, GGUF và các kỹ thuật quantization giúp chạy model 70B trên máy cá nhân. Những bước nhảy vọt về hiệu năng thường đến từ software engineering ở tầng thấp, không phải từ kiến trúc model mới.

Đối với developer, GigaToken là công cụ mới — đặc biệt hữu ích nếu bạn đang build data pipeline, inference platform, hoặc bất kỳ hệ thống nào xử lý lượng lớn văn bản trước khi đến LLM. Nhưng bài học lớn hơn: đừng bao giờ cho rằng thứ gì đó "đã đủ nhanh." Luôn có room — đôi khi là 1000x.

Những điều cần biết

  • GigaToken đạt 24.53 GB/s tokenize GPT-2 trên AMD EPYC 9565 — nhanh gấp ~1000 lần HuggingFace, ~700 lần tiktoken
  • Viết bằng Rust, dùng SIMD thay regex cho pretokenization + caching thông minh + giảm Python overhead
  • Drop-in replacement cho HuggingFace tokenizers và tiktoken — đổi 1 dòng code
  • Hỗ trợ 20+ tokenizer: GPT-2, Llama, Qwen, DeepSeek, Phi, OLMo, Gemma, GLM, Kimi, Mistral...
  • Training data prep: 1 TB text tokenize trong ~41 giây thay vì 11 giờ
  • Inference routing: tokenizer là critical path trong nền tảng AI có hàng triệu request/ngày
  • Câu hỏi mở: nếu tokenization còn room 1000x, còn thành phần nào khác cũng đang chờ được tối ưu?

Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts