Real-SWE: chi phí mỗi issue đã giải quyết
Cập nhật September 27, 2026 · đăng lần đầu September 27, 2026
Real-SWE ra mắt ngày 12 tháng 9 năm 2026 và nhận 275 điểm cùng 158 bình luận trên Hacker News. Tiền đề này là phần mà hầu hết các mô hình chi phí làm sai: bộ benchmark là công khai, đã bị mô hình ghi nhớ, và không đại diện cho mã mà agent của bạn thực sự chạm tới. Real-SWE chạy mô hình trên các kho mã doanh nghiệp thực tế, riêng tư.
Vì sao con số chi phí quan trọng hơn điểm số
Một benchmark công khai cho bạn tỷ lệ đạt. Nó không cho bạn chi phí. Chi phí mỗi issue đã giải quyết cần ba thứ cùng lúc:
- Tỷ lệ đạt trên các tác vụ khó, riêng tư.
- Số token tiêu thụ mỗi lần thử, kể cả những lần thất bại.
- Số lần thử — mô hình có cần thử lại, sửa kế hoạch, hay vòng lặp so diff rồi nghĩ lại không?
Nhân các yếu tố này lại, bạn có con số duy nhất tương ứng với một dòng chi phí. Một mô hình kém người dẫn đầu 4 điểm nhưng giải quyết issue trong một lần thử với một phần ba số token thì rẻ hơn tính trên mỗi issue đã giải quyết, và trên một backlog thực, khoảng cách này tích lũy nhanh hơn những gì chênh lệch điểm gợi ý.
Vì sao benchmark công khai thổi phồng chất lượng
Codebase doanh nghiệp có những đặc điểm phá vỡ các giả định của benchmark công khai: quy ước nội bộ dài, bất biến không được tài liệu hóa, test mã hóa các tai nạn lịch sử, và hệ thống build mà không ai hiểu hết. Một mô hình nhận ra mẫu trên một repo công khai không thể làm điều đó trên monorepo 400 file với ba năm quyết định chồng chất. Đó là lý do một kết quả được bàn tán nhiều trong tháng này là mô hình viết sáng tạo 27B có trọng số mở đạt mức Fable 5 với giá được báo cáo rẻ hơn 40x — trọng số mở bắt đầu từ một tiên nghiệm về repo cục bộ mà các mô hình API không có.
Tính toán thực tế
Hãy lấy một repo backend thực có 40 issue trong phạm vi. Giả sử mô hình rẻ hơn giải quyết được 22 issue trong một lần thử với 60K input / 8K output, còn mô hình cao cấp giải quyết 26 issue với hệ số thử lại 1.4x ở mức 90K input / 14K output. Theo giá Opus 5.5 ($4/$20, đọc cache $0.20):
| Mô hình | Đã giải quyết | Chi phí mỗi issue | Tổng |
|---|---|---|---|
| Nhóm rẻ | 22 | $0.32 | $7.04 | Nhóm cao cấp | 26 | $0.61 | $15.86 |
Nhóm cao cấp tốn gấp 2.3x tổng chi phí để đổi lấy nhiều hơn 18% issue đã giải quyết. Trên backlog 40 issue, chênh lệch là $9. Cùng sự đánh đổi đó ở 4,000 issue mỗi tháng là $880 — và vẫn chỉ mua thêm được 18% thông lượng. Nhóm rẻ không hẳn là sai; bạn đang đánh đổi tỷ lệ giải quyết lấy khối lượng, và câu trả lời đúng tùy thuộc vào việc một issue bị bỏ sót có đáng giá hơn một đô la hay không.
Cần đo những gì
- Chi phí mỗi issue đã giải quyết, không phải mỗi lần thử. Mẫu số là các PR đã merge, không phải số yêu cầu.
- Hệ số thử lại theo từng mô hình. Mô hình ở mức 1.4x đã tốn bằng một phần ba giá niêm yết trước khi bạn tính bất cứ thứ gì khác.
- Token trên mỗi diff được chấp nhận, bao gồm cả token lập kế hoạch và tự rà soát mà diff không bao giờ hiển thị.
- Số phút người review. Một mô hình rẻ hơn 12% nhưng mất thêm 20% thời gian review thì đắt hơn.
Kết luận
Benchmark công khai xếp hạng năng lực trên các tác vụ không giống backlog của bạn. Real-SWE là một nỗ lực ban đầu cho phiên bản trung thực hơn. Cho đến khi bạn chạy nó trên các repo của chính mình, hãy coi mỗi so sánh mô hình là một giả thuyết về chi phí mỗi issue đã giải quyết, và định giá giả thuyết đó bằng số token của riêng bạn.
Liên quan
- Chi phí thực mỗi tác vụ: các mô hình hàng đầu
- Chi phí mỗi tác vụ thành công
- Chi phí lập trình agent nặng: Claude so với Qwen
- Kiểm soát chi phí đánh giá
- Định giá một mô hình trọng số mở
Bạn muốn áp dụng điều này cho hệ thống của mình? Hãy mang theo hóa đơn nhà cung cấp, nhật ký gateway và các quy trình chính; chúng tôi sẽ xác định yếu tố chi phí và hướng tiết kiệm. Đặt lịch kiểm toán miễn phí →