MCP 2026-07-28: Bỏ Session, Nửa Tỷ Lượt Tải Và Cái Giá Của Stateless
MCP chính thức bỏ session, chuyển sang stateless. Không còn sticky session, không cần shared storage — nhưng migration không miễn phí. Đây là những gì developer cần biết.
Những suy nghĩ, trải nghiệm và góc nhìn kỹ thuật trong hành trình làm phần mềm của mình.
Hashtag phổ biến
MCP chính thức bỏ session, chuyển sang stateless. Không còn sticky session, không cần shared storage — nhưng migration không miễn phí. Đây là những gì developer cần biết.
3 tuần sau tuyên bố 'xong trong 11 ngày', bản Rust rewrite của Bun vẫn chưa có release. 2.475 PR AI đang chờ CI/CD, chi phí thực tế gần 800.000 USD.
Formal verification từng tốn công gấp 10 lần việc lập trình. LLM đang xóa bỏ rào cản đó — chứng minh Zstandard trong Lean chỉ mất 20 phút.
Một maintainer ADB của Google đề xuất khóa ADB chỉ qua Wi-Fi, chặn kết nối loopback — động thái có thể xóa sổ Shizuku và hàng loạt công cụ open-source.
Anthropic ra mắt Claude Opus 5: #1 SWE-bench 97%, tiệm cận Fable 5 với giá chỉ bằng nửa. Cùng mức giá Opus 4.8, mạnh gấp đôi Frontier-Bench.
Etched gọi 300 triệu USD, định giá 10.3 tỷ, tăng gấp đôi sau 7 tháng. Chip Sohu — ASIC chuyên inference transformer — thách thức trực diện Nvidia.
Tokenizer LLM đạt 24.53 GB/s, nhanh gấp ~1000 lần HuggingFace và ~700 lần tiktoken. Viết bằng Rust, dùng SIMD. Không chỉ nhanh: nó thay đổi cách xử lý dữ liệu cho LLM.
Google ra mắt Gemini 3.6 Flash — dùng ít token hơn 17% so với 3.5 Flash, giá rẻ hơn, điểm benchmark cao hơn. Flash-Lite đạt 350 token/s chỉ $0.3/1M input, tối ưu cho agentic workflow quy mô lớn.
Thị phần AI Mỹ trên OpenRouter sụt từ 70% xuống 30% trong một năm. Model open-weight Trung Quốc đang định hình lại cuộc chơi — với developer là người hưởng lợi đầu tiên.
Chỉ trong 3 ngày, Alibaba và Moonshot AI lần lượt công bố Qwen 3.8 (2.4T tham số) và Kimi K3 (2.8T tham số) — cả hai đều mở trọng số. Cuộc đua đang định hình lại AI toàn cầu.
PrismML vừa công bố Bonsai 27B — model 27B tham số nén xuống còn 3.9GB, chạy được trên iPhone 17 Pro với 11 token/s. Ternary variant giữ 95% benchmark so với bản full-precision.
Bảng giá chỉ hiện $/token, nhưng mỗi model cắt cùng một file ra số token khác hẳn. Claude tokenizer mới đếm nhiều hơn GPT 73% cho TypeScript — ngôn ngữ coding agent dùng nhiều nhất.