Skip to content

Claude Opus 5 Ra Mắt: Tiệm Cận Fable 5, Chi Phí Chỉ 50%

Karify98 & Amy 🌸·
Cover Image for Claude Opus 5 Ra Mắt: Tiệm Cận Fable 5, Chi Phí Chỉ 50%

Không Chỉ Là Một Bản Nâng Cấp

Ngày 24/7, Anthropic chính thức ra mắt Claude Opus 5 — model mới nhất trong dòng Opus, lựa chọn mặc định của phần lớn developer dùng Anthropic API. Trong 5 giờ đầu, bài đăng trên Hacker News đạt 1,106 điểm và 590 bình luận.

Điểm thực sự đáng chú ý là chiến lược giá: Opus 5 có hiệu năng tiệm cận dòng frontier model Fable 5 — vốn có giá $10/$50 mỗi triệu token — với giá chỉ $5/$25, bằng đúng một nửa.

Cùng một mức giá với Opus 4.8, developer nhận được hiệu năng gấp đôi trên Frontier-Bench. Anthropic đang chơi bài "nhiều hơn với cùng số tiền" thay vì tăng giá.

Benchmark: Dẫn Đầu Hầu Hết Mọi Mặt Trận

Theo BenchLM, Opus 5 đạt điểm tổng 85.88/100, xếp #1 trong số 215 model được theo dõi:

Model Điểm BenchLM Giá (input/output / 1M token)
Claude Opus 5 85.88 (#1) $5 / $25
Claude Mythos 5 83.01 (#2) N/A (Trusted Access)
Claude Fable 5 82.76 (#3) $10 / $50
GPT-5.6 Sol 81.46 (#4) $5 / $25
Kimi K3 79.98 (#5) miễn phí
Claude Opus 4.8 77.44 (#6) $5 / $25

Ba điểm sáng nhất:

SWE-bench Verified: 97% (#1). Benchmark sát thực tế nhất với công việc hàng ngày — sửa lỗi trên codebase Python thực như Django, Flask, scikit-learn. Opus 5 dẫn đầu toàn bảng, vượt GPT-5.6 Sol (96.2%) và Fable 5 (95%).

Frontier-Bench v0.1: 43.3% — gấp đôi Opus 4.8. Benchmark agentic coding khó nhất hiện tại, yêu cầu model tự lập kế hoạch, viết code, debug và lặp lại. Opus 5 vượt Opus 4.8 với chi phí mỗi task thấp hơn.

CursorBench 3.2: kém Fable 5 0.5% — giá rẻ hơn một nửa. Với người dùng CursorClaude Code, tín hiệu rất rõ: chất lượng gần Fable 5, không phải trả gấp đôi.

Ngoài coding, Opus 5 dẫn đầu Knowledge (#1/53 model, điểm 93.5), đứng thứ ba Agentic (#3/129, điểm 69.4) và Multimodal (#3/32, điểm 89.1). Điểm yếu duy nhất: Coding thuần đứng #9/130 — Anthropic vẫn giữ Fable 5 cho tác vụ coding đỉnh cao nhất.

Điểm Khác Biệt Thật Sự: Khả Năng Tự Kiểm Chứng

Điều khiến Opus 5 khác Opus 4.8 không chỉ là benchmark. Nó là cách model này hành xử khi làm việc.

Trên Frontier-Bench, Opus 5 được giao một bản vẽ kỹ thuật và yêu cầu viết code tái tạo mô hình 3D. Vấn đề: model không có cách nào "nhìn" trực tiếp bản vẽ. Cách xử lý của Opus 5: tự viết một pipeline computer vision để trích xuất hình học từ pixel thô, rồi tái tạo toàn bộ chi tiết máy. Không model nào khác làm được sau 5 lần thử — Opus 5 làm được nhiều lần.

Một kỹ sư tại công ty giao dịch dùng Opus 5 xây dựng data feed cho sàn giao dịch mới chỉ trong một phiên. Các model trước không thể hoàn thành task này ngay cả khi có kế hoạch chi tiết. Opus 5 còn tự xây dựng test harness để kiểm tra code — vì không có live feed để validate.

Một khách hàng early-access mô tả: "Trong lúc tái cấu trúc kiến trúc, Opus 5 phản bác thiết kế tôi đề xuất, và không chịu lùi bước khi tôi khăng khăng. Thay vào đó, nó giải thích chính xác điểm nào trong ý tưởng có giá trị, thu hẹp phản đối về một câu hỏi thiết kế duy nhất, rồi đề xuất giải pháp dung hòa."

Đây không còn là pattern "AI vâng lời" quen thuộc. Opus 5 có chính kiến — đó chính là điều Anthropic muốn nhấn mạnh với từ "thoughtful and proactive."

Hiệu Quả Token: Làm Nhiều Hơn Với Ít Token Hơn

Một chi tiết quan trọng với developer đang tính chi phí: Opus 5 tiêu thụ ít token hơn đáng kể so với Opus 4.8. Một khách hàng trong lĩnh vực pháp lý báo cáo giảm 26% token ở cùng mức reasoning. Một công ty tài chính ghi nhận "ít hơn một phần ba lượt tool call và 60% thời gian xử lý."

Kết hợp với giá không đổi, tổng chi phí thực tế cho mỗi task giảm — không chỉ trên lý thuyết.

Anthropic cũng giới thiệu cơ chế effort control: developer có thể chọn low/medium/high/xhigh/max effort tùy nhu cầu. Ở low effort, Opus 5 vẫn vượt qua mọi model khác trên Zapier AutomationBench về tỉ lệ hoàn thành task. Ở max effort, nó đạt điểm cao nhất nhưng không tiêu tốn token như Fable 5.

Điều Này Có Ý Nghĩa Gì Với Developer?

Nâng cấp miễn phí — không cần làm gì

Opus 5 là model mặc định trên Claude Max và model mạnh nhất trên Claude Pro. Ai đang dùng Opus 4.8 qua API hoặc Claude Pro, ngân sách không thay đổi. Chất lượng cao hơn, cùng giá.

Fable 5 giờ chỉ dành cho task cực khó

Với Opus 5 đạt 97% SWE-bench, phần lớn tác vụ coding hàng ngày không cần đến Fable 5. Chỉ những task yêu cầu độ chính xác tuyệt đối hoặc reasoning phức tạp nhất mới cần nâng lên Fable 5. Tiết kiệm 50% chi phí cho phần lớn workload.

AI có chính kiến — con dao hai lưỡi

Khả năng phản bác thiết kế của Opus 5 là bước tiến về chất lượng reasoning — nhưng cũng đặt ra câu hỏi mới. Khi nào nên nghe theo AI? Khi nào nên ghi đè? Cân bằng giữa "biết lắng nghe" và "mù quáng làm theo" sẽ là kỹ năng quan trọng với model thế hệ mới.

Cuộc đua giá LLM chưa dừng

Anthropic giữ nguyên giá Opus 5 ở $5/$25 trong khi tăng hiệu năng gấp đôi cho thấy áp lực cạnh tranh vẫn rất lớn. DeepSeek, Qwen, Kimi liên tục đẩy giá xuống. GPT-5.6 Sol cũng ở mức $5/$25. Developer là bên hưởng lợi lớn nhất.

Takeaways

  • Opus 5 = Fable 5 "giá rẻ". Cùng benchmark, chi phí một nửa — phù hợp cho phần lớn tác vụ coding và phân tích.
  • Không tăng giá. Vẫn $5/$25 mỗi triệu token — nâng cấp miễn phí từ Opus 4.8.
  • Tự kiểm chứng là skill mới. Model không chỉ viết code mà còn tự kiểm thử, tự gỡ lỗi, tự phản bác thiết kế sai.
  • 26% ít token hơn ở max reasoning. Chi phí thực tế thấp hơn giá niêm yết.
  • Đã có sẵn trên Claude Pro và API. Không cần làm gì để bắt đầu dùng.

Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts