Skip to content

Gemini 3.6 Flash: Ít Token Hơn, Rẻ Hơn, Tốt Hơn Cho AI Agent

Karify98 & Amy 🌸·
Cover Image for Gemini 3.6 Flash: Ít Token Hơn, Rẻ Hơn, Tốt Hơn Cho AI Agent

Ngày 21/07/2026, Google DeepMind tung ba model Flash mới: Gemini 3.6 Flash, 3.5 Flash-Lite, và 3.5 Flash Cyber. Cùng lúc, họ xác nhận Gemini 4 đã bắt đầu pre-training.

Tín hiệu rất rõ: Google không đua benchmark với GPT-5.6 hay Fable. Họ đặt cược vào bài toán chi phí — nơi mỗi token trong agentic workflow đều có giá.

3.6 Flash: Token ít hơn 17%, code tốt hơn

3.6 Flash thay thế trực tiếp 3.5 Flash. Khác biệt cốt lõi: token efficiency.

Artificial Analysis Index ghi nhận 3.6 Flash tiêu thụ ít hơn 17% output token. Trên DeepSWE của Datacurve, mức cắt giảm lên tới 65%. Con số thực tế: một agent task trung bình gọi model 8-10 vòng, ~2000 output token mỗi vòng. Với 3.5 Flash, output cost vào khoảng $0.15/task. Với 3.6 Flash: $0.11 — tiết kiệm ~27%. Nhân lên hàng nghìn task mỗi ngày, đây là khoản cắt giảm không cần sửa một dòng code.

Chất lượng cũng tăng. Không phải tăng nhẹ:

Benchmark 3.6 Flash 3.5 Flash
DeepSWE (coding agent) 49% 37%
MLE Bench (ML research) 63.9% 49.7%
OSWorld-Verified (computer use) 83.0% 78.4%
GDPval-AA v2 (knowledge work) 1421 1349

Điểm nhấn thứ hai: computer use giờ là built-in tool trong Gemini API. Không cần Puppeteer, không cần sandbox riêng. Model tự thao tác với giao diện. Ít thành phần chuyển động hơn — ít thứ để debug hơn.

Giá: $1.50/1M input, $7.50/1M output — thấp hơn 3.5 Flash.

3.5 Flash-Lite: Nhanh. Rẻ. Vượt flagship cũ.

3.6 Flash là workhorse. 3.5 Flash-Lite là lựa chọn cho high-throughput — nơi latency và volume quan trọng hơn chất lượng tuyệt đối.

Tốc độ: 350 output token/giây. Giá: $0.3/1M input, $2.5/1M output — rẻ hơn 5 lần so với 3.6 Flash. Để có context: DeepSeek V4 Flash ở $0.14/$0.28 (official API), Claude Haiku 4.5 ở $1/$5. Flash-Lite nằm giữa DeepSeek và Haiku về giá, nhưng có lợi thế tốc độ và hệ sinh thái Google.

Điều đáng nói nhất: nó vượt mặt 3 Flash — model từng là flagship — trên benchmark agentic:

Benchmark 3.5 Flash-Lite 3 Flash
SWE-Bench Pro 54.2% 49.6%
OSWorld-Verified 74.0% 65.1%
Terminal-Bench 2.1 54% 31% (3.1 Flash-Lite)

Một model $0.3/1M token đánh bại flagship cũ. Tốc độ tiến bộ của các model "nhỏ, rẻ, nhanh" là câu chuyện đáng chú ý nhất — và cũng bị lấp nhất giữa những cuộc đua benchmark của GPT-5.6 và Fable.

Flash-Lite có bốn mức suy luận: minimal, low, medium, high. Minimal/low cho task đơn giản khối lượng lớn. Medium/high cho multi-step subagent. Cộng computer use built-in, đây là lựa chọn tự nhiên cho agentic search, document processing, và data extraction pipeline quy mô production.

3.5 Flash Cyber: AI bảo mật — sau cánh cửa khóa

Model thứ ba đi hướng chuyên biệt. Flash Cyber được fine-tune để tìm và sửa lỗ hổng, chạy trong CodeMender — hệ thống multi-agent dùng nhiều instance song song để quét code và tổng hợp báo cáo.

Trên CyberGym, CodeMender đạt hiệu năng cạnh tranh với model frontier. Nhưng Flash Cyber chỉ dành cho chính phủ và đối tác tin cậy — chương trình limited-access pilot.

Lý do chính thức: dual-use risk. Model tìm lỗ hổng cũng có thể tự động hóa tấn công. Hệ quả phụ: công cụ phòng thủ mạnh tập trung vào tay số ít. Trong bối cảnh model frontier đã tự viết được PoC exploit (ExploitBench, SEC-Bench Pro), phòng thủ tụt hậu là rủi ro thật — và quyết định khóa model này của Google xứng đáng được tranh luận nhiều hơn.

Góc nhìn

Không có timeline cho 3.5 Pro. Google chỉ nói "sớm nhất có thể." Dòng quan trọng nhất nằm ở cuối blog: Gemini 4 đã bắt đầu pre-training — đợt huấn luyện "tham vọng nhất."

Chiến lược hai tầng: Flash cạnh tranh chi phí cho production hôm nay. Gemini 4 là canh bạc cho ngày mai.

Với developer đang build AI agent, tín hiệu từ đợt release này rất rõ: chi phí token không còn là rào cản. Flash-Lite ở $0.3/1M input, 350 tok/s — gọi model 100 lần cho một task phức tạp cũng chỉ tốn vài cent. Mô hình kinh tế cho AI agent đang thay đổi. Cuộc đua không còn là ai thông minh nhất. Là ai rẻ nhất.

Những điều cần biết

  • 3.6 Flash: ít token hơn 17%, code tốt hơn, rẻ hơn, computer use built-in — thay thế 3.5 Flash
  • 3.5 Flash-Lite: $0.3/1M input, 350 tok/s, vượt 3 Flash trên benchmark agent — tối ưu cho high-throughput
  • Computer use built-in trên cả hai model — browser agent đơn giản hơn đáng kể
  • Flash Cyber: chỉ cho chính phủ — Google chọn kiểm soát thay vì mở
  • Gemini 4: pre-training đã bắt đầu; 3.5 Pro chưa có ngày

Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts