Skip to content

Real-SWE: benchmark lột trần AI coding agent trên codebase thật

Karify98 & Amy 🌸·
Cover Image for Real-SWE: benchmark lột trần AI coding agent trên codebase thật

Specific Labs vừa công bố Real-SWE, một benchmark đánh giá AI coding agent trên codebase sản xuất thật — không phải bài toán tự chế hay repo public đã bị model học thuộc. Kết quả: model dẫn đầu chỉ giải đúng 38.8% task. Bảy model còn lại đều dưới 34%.

Task thật, không phải bài mẫu

Điểm khác biệt của Real-SWE nằm ở nguồn task. Thay vì viết đề bài mô phỏng, Specific Labs license trực tiếp codebase từ các công ty thật — trong đó có một đối thủ của Luma/Partiful với hơn 200 nghìn người dùng và top 100 App Store, một nền tảng fintech tiêu dùng xử lý hơn 100 nghìn bank statement, và vài nền tảng AI sales doanh nghiệp. Mỗi task là việc một kỹ sư thật từng phải làm, với toàn bộ context và độ phức tạp đi kèm — quy ước code riêng của công ty, business logic chồng chéo, hệ thống liên quan nhiều service.

Một task mẫu: sửa logic tính thuế hóa đơn trong dịch vụ NestJS/TypeScript, nơi mỗi doanh nghiệp trên nền tảng tự chọn cách quyết toán thuế khác nhau — có bên tự set rate cố định, có bên gọi API TaxJar theo địa chỉ khách hàng, có bên miễn thuế hoàn toàn. Agent phải đọc đúng cấu hình từng doanh nghiệp, gọi đúng service (sandbox hay production tùy tài khoản), xử lý trường hợp địa chỉ bị TaxJar từ chối mà không được chặn hóa đơn, rồi ghi lại giao dịch vào InfluxDB đúng số hóa đơn để đối soát. Không có chỗ nào trong task này từng xuất hiện công khai trên internet.

Đây chính là lý do độ khó cao hơn hẳn các benchmark cũ. Hướng dẫn task ở Real-SWE dài trung vị 1.742 ký tự — ngắn hơn FrontierCode (2.056) và DeepSWE (1.975) — nhưng reference solution phải sửa trung vị 11 file, gần gấp đôi con số 6 file của hai benchmark kia. Nói cách khác, hướng dẫn ngắn gọn buộc agent tự suy ra phần lớn chi tiết triển khai từ chính codebase, đúng như cách một kỹ sư mới vào công ty phải tự đọc code để hiểu hệ thống.

Bảng xếp hạng: khoảng cách giữa các model không lớn như tưởng

Theo benchmark tự công bố (chưa có bên thứ ba kiểm chứng độc lập), kết quả resolution rate — tính bằng pass@1 trung bình qua 8 lần chạy độc lập mỗi task — như sau:

Hạng Model Harness Resolution rate
1 Fable 5.1 Claude Code 38.8%
2 GPT-6 Astra Codex CLI 33.8%
3 Gemini 3.8 Flash Gemini CLI 31.2%
4 GLM 5.3 Claude Code 28.8%
=5 Grok 4.6 Grok Build 23.8%
=5 Muse Spark 1.3 Muse Code 23.8%
7 Kimi K3 Kimi Code 18.8%
8 GPT-5.6 Sol Codex CLI 16.2%

Khoảng cách từ hạng 1 xuống hạng 8 chỉ là 22.6 điểm phần trăm — không hề rộng như những benchmark mang tính trình diễn thường thấy. Đáng chú ý hơn: Real-SWE đánh giá cặp model-và-harness, không tách rời model. GLM 5.3 và Fable 5.1 cùng chạy qua Claude Code nhưng cách biệt 10 điểm — cho thấy chất lượng model vẫn quyết định phần lớn kết quả, harness không san bằng khác biệt.

Mỗi model fail một kiểu khác nhau

Phân tích lỗi cho thấy các model không chỉ khác nhau về điểm số, mà khác cả về cách thất bại. Grok 4.6 và Kimi K3 dẫn đầu nhóm lỗi "bỏ sót yêu cầu" (67.2% và 53.8% trong các lần fail của từng model) — nghĩa là agent code đúng một phần nhưng thiếu behavior đề bài yêu cầu. Gemini 3.8 Flash và Muse Spark 1.3 lại mắc lỗi "tích hợp sai" nhiều nhất (49.1% và 41.0%) — ý tưởng đúng nhưng nối vào hệ thống hiện có sai cách. GPT-5.6 Sol dẫn đầu nhóm "giả định chưa kiểm chứng" (43.3%) — đoán mò về hệ thống thay vì đọc code để xác minh.

Một con số đáng chú ý khác: rollout dưới 10 phút fail 71.4% (70/98), rollout dài hơn 10 phút fail 73.4% (398/542). Chạy agent lâu hơn gần như không cải thiện tỷ lệ thành công — dấu hiệu cho thấy vấn đề không nằm ở thời gian suy nghĩ, mà ở việc agent thiếu context về quy ước và ràng buộc business cụ thể của từng công ty.

Điều cần biết

  • Đừng lấy điểm SWE-bench làm chuẩn cho hiệu năng thực tế trong công ty. Con số 70-80% resolution rate quen thuộc trên các benchmark cũ phản ánh task từ repo mã nguồn mở phổ biến — nhiều khả năng đã lọt vào dữ liệu huấn luyện. Trên codebase private với quy ước riêng, hiệu năng rơi mạnh.
  • Chi phí không tỷ lệ thuận với chất lượng. Model đứng đầu (Fable 5.1) tốn ước tính $6.96 mỗi rollout — gần gấp ba Gemini 3.8 Flash ($2.50) dù chỉ hơn 7.6 điểm phần trăm resolution rate. Với task lặp lại quy mô lớn, bài toán trade-off giữa độ chính xác và chi phí cần cân nhắc kỹ hơn là chọn model "tốt nhất" theo leaderboard.
  • "Bỏ sót yêu cầu" là lỗi nguy hiểm nhất để review thủ công. Code chạy được, test pass, nhưng thiếu một nhánh xử lý mà đề bài yêu cầu — loại lỗi này dễ lọt qua review nhanh hơn nhiều so với lỗi cú pháp hay crash rõ ràng.
  • Review PR do agent tạo ra cần checklist yêu cầu gốc, không chỉ đọc diff. Vì lỗi phổ biến nhất là thiếu behavior chứ không phải sai cú pháp, so sánh diff với yêu cầu ban đầu quan trọng hơn đọc code có "sạch" hay không.

Real-SWE không phủ nhận việc AI coding agent hữu ích — nó chỉ ra rõ giới hạn: agent hiện tại giỏi việc có ngữ cảnh sẵn, nhưng còn xa mới đáng tin cậy để giao task doanh nghiệp mà không có người giám sát kỹ.


Bài viết được hỗ trợ bởi AI (Amy 🌸). Nội dung đã được kiểm duyệt bởi tác giả.

Related Posts