Skip to content

Claude Opus 5.5: mạnh hơn Opus 5, giá giảm 40%

Karify98 & Amy 🌸·
Cover Image for Claude Opus 5.5: mạnh hơn Opus 5, giá giảm 40%

Anthropic vừa ra mắt Claude Opus 5.5, model đầu tiên trong dòng Claude 5.5. Điểm đáng chú ý nhất không phải benchmark cao hơn — mà là chi phí vận hành giảm 40% so với Opus 5, trong khi vẫn là model mạnh nhất Anthropic từng công bố.

Chuyện gì vừa xảy ra

Theo blog chính thức của Anthropic đăng ngày 22/9, Opus 5.5 là bản release đầu tiên kể từ khi CEO Dario Amodei kêu gọi "pacing the frontier" — giữ nhịp phát triển AI chậm lại để các biện pháp an toàn theo kịp năng lực model. Trước khi phát hành, Opus 5.5 được đánh giá bởi các tổ chức bên ngoài gồm METR và Frontier Design.

Về giá, input token giảm còn 4 USD/triệu (giảm 20% so với Opus 5's 5 USD), output token 20 USD/triệu (giảm từ 25 USD). Đáng chú ý nhất là cache read — chiếm phần lớn chi phí trong các tác vụ agentic và coding — giảm tới 60%, còn 0.20 USD/triệu token so với 0.50 USD trước đó. Anthropic cũng tăng giới hạn sử dụng 5 giờ trên các gói Pro, Max, Team và Enterprise theo seat.

Hiệu năng: một bước nhảy so với Opus 5

Trên Terminal-Bench 4.0 — benchmark đo khả năng hoàn thành tác vụ chuyên nghiệp nhiều bước trong dòng lệnh — Opus 5.5 đạt 66.4%. Con số này so với 52.3% của Opus 5 và 57.9% của GPT-6 Astra (theo số liệu OpenAI công bố). Trên GDPval-AA v2.1, benchmark đánh giá công việc thực tế qua 44 ngành nghề, Opus 5.5 đạt 1846 điểm Elo, vượt Opus 5 (1708 điểm) và Claude Fable 5.1 (1735 điểm).

Một tester nội bộ dùng Opus 5.5 để migrate một codebase 680,000 dòng trong chưa đầy một ngày — việc mà một team kỹ sư thường mất vài tuần. Ở bài test khác, khi được yêu cầu cắt giảm load time trên toàn bộ trang của một web app, Opus 5.5 thành công 39/40 lần. Opus 5 chỉ cải thiện nhỏ, và đôi khi làm thay đổi hành vi ứng dụng ngoài ý muốn.

Cần lưu ý: đây là số liệu do chính Anthropic công bố kèm điều kiện test cụ thể (effort level, harness). Một số benchmark như AutomationBench được Zapier chạy độc lập và báo cáo lại, có ghi rõ phương pháp.

An toàn: điểm audit hành vi cao nhất từ trước tới nay

Trên automated behavioral audit — bộ đánh giá alignment toàn diện nhất mà Anthropic đang chạy, kiểm tra Claude qua gần 2,000 kịch bản mô phỏng — Opus 5.5 đạt điểm tốt nhất trong số các model Claude từng test. Model này ít có xu hướng thực hiện hành động khó đảo ngược hoặc vượt ra ngoài ranh giới được giao, và chống prompt injection tốt hơn Opus 5.

Vì năng lực trong sinh học và an ninh mạng tương đương Claude Mythos 5.1, Anthropic áp dụng các biện pháp bảo vệ tương tự Claude Fable 5.1 cho Opus 5.5 — bao gồm Life Sciences Verification Program cho nghiên cứu sinh học, và mở rộng Cyber Verification Program cho các chuyên gia an ninh mạng đã được xác thực trong thời gian tới.

Coding agent: sandbox mở, classifier chặn hành động rủi ro

Với các doanh nghiệp chạy agent tự động nhiều giờ liền trong hệ thống của mình, Anthropic bổ sung ba lớp bảo vệ: classifier kiểm tra mọi hành động trước khi thực thi, sandbox mã nguồn mở mà đội bảo mật có thể audit, và code review tự động bắt lỗi bảo mật trước khi merge.

Trên benchmark prompt injection do Gray Swan — công ty bảo mật AI — chạy độc lập, Opus 5.5 đạt tỷ lệ bị tấn công thành công thấp ngang Claude Fable 5.1, thấp nhất trong số các model được test.

So what — ảnh hưởng gì tới developer?

  • Chi phí agentic coding giảm mạnh: cache read rẻ hơn 60% có nghĩa các workflow dùng nhiều context lặp lại (code review, refactor lớn) rẻ đi đáng kể, không chỉ nhanh hơn
  • Tác vụ dài, phức tạp khả thi hơn: migrate codebase hàng trăm nghìn dòng trong vài giờ thay vì vài tuần. Bài toán kinh tế của các dự án refactor lớn thay đổi hẳn — trước đây nhiều team bỏ qua vì chi phí nhân lực quá cao
  • Prompt injection resistance quan trọng hơn khi agent chạy tự động: với agent có quyền truy cập hệ thống thật (đọc email, gọi API, chạy lệnh), khả năng chống bị "dắt mũi" bởi nội dung độc hại trong dữ liệu đầu vào không còn là tính năng phụ
  • Sonnet 5.5 và Haiku 5.5 sắp ra mắt: nếu đang build trên Sonnet vì lý do chi phí, đáng để chờ vài tuần thay vì migrate ngay sang Opus 5.5

Điểm khiến release này khác các lần trước không phải là con số benchmark — các hãng AI đều tuyên bố "model mạnh nhất" mỗi vài tháng. Cái đáng chú ý là Anthropic chọn giảm giá 40% thay vì giữ giá và bán "sức mạnh" như một premium tier. Giá inference vẫn là rào cản lớn nhất để chạy agent ở quy mô production. Đây là tín hiệu cuộc đua đang chuyển từ "ai mạnh nhất" sang "ai rẻ nhất trên mỗi đơn vị công việc hoàn thành".

Điều cần biết

  • Claude Opus 5.5 ra mắt 22/9, giá giảm 40% so với Opus 5 ở mức sử dụng mặc định; cache read giảm 60%, còn 0.20 USD/triệu token
  • Đạt 66.4% trên Terminal-Bench 4.0 và 1846 Elo trên GDPval-AA v2.1, cao nhất trong các model Anthropic đã công bố
  • Điểm cao nhất từ trước tới nay trên automated behavioral audit — bộ đánh giá alignment gần 2,000 kịch bản
  • Chống prompt injection ngang Claude Fable 5.1 trên benchmark độc lập của Gray Swan
  • Sandbox mã nguồn mở, classifier chặn hành động rủi ro, code review tự động cho agent chạy dài hạn
  • Claude Sonnet 5.5 và Claude Haiku 5.5 sẽ ra mắt trong vài tuần tới

Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts