Real-SWE 해결 이슈당 비용
업데이트 September 27, 2026 · 최초 게시 September 27, 2026
Real-SWE는 2026년 9월 12일 공개되었고 Hacker News에서 275포인트와 댓글 158개를 받았습니다. 대부분의 비용 모델이 잘못 짚는 부분이 바로 전제입니다. 벤치마크 스위트는 공개되어 있고, 학습 데이터에 포함되어 있으며, 에이전트가 실제로 다루는 코드를 대표하지 못합니다. Real-SWE는 모델을 비공개 실제 기업 저장소에서 실행합니다.
점수보다 비용 수치가 중요한 이유
공개 벤치마크는 통과율을 알려 줄 뿐 비용은 알려 주지 않습니다. 해결된 이슈당 비용을 구하려면 다음 세 가지가 동시에 필요합니다.
- 어려운 비공개 과제에서의 통과율.
- 실패한 시도를 포함한 시도당 소비 토큰 수.
- 시도 횟수 — 모델이 재시도, 계획 수정, 디프 검토 후 재구상 같은 루프를 필요로 했는가?
이 세 값을 곱하면 비용 항목과 대응되는 유일한 수치가 나옵니다. 1위 모델보다 점수가 4점 낮아도 한 번의 시도로 토큰을 3분의 1만 쓰고 이슈를 해결하는 모델은, 해결된 이슈당 비용이 더 저렴합니다. 실제 백로그에서는 이 차이가 점수 격차가 암시하는 것보다 빠르게 누적됩니다.
공개 벤치마크가 품질을 과대평가하는 이유
기업 코드베이스에는 공개 벤치마크의 가정을 무너뜨리는 특성이 있습니다. 길고 내부적인 규약, 문서화되지 않은 불변식, 과거의 사고를 그대로 담은 테스트, 그리고 아무도 완전히 이해하지 못하는 빌드 시스템입니다. 공개 저장소에서 패턴을 잘 맞히는 모델도 3년치 결정이 쌓인 400개 파일짜리 모노레포에서는 그렇게 하지 못합니다. 그래서 이번 달 널리 논의된 결과는 27B 오픈 웨이트 창작 글쓰기 모델이 Fable 5 수준의 성능을 보이면서 가격은 40배 저렴하다는 보고였습니다. 오픈 웨이트 모델은 API 모델에는 없는 로컬 저장소에 대한 사전 지식에서 출발하기 때문입니다.
계산해 보기
범위에 이슈가 40개 있는 실제 백엔드 저장소를 생각해 봅시다. 저렴한 모델은 입력 60K / 출력 8K로 22개를 한 번의 시도에 해결하고, 프리미엄 모델은 재시도 배율 1.4x로 입력 90K / 출력 14K를 써서 26개를 해결한다고 가정합니다. Opus 5.5 요금($4/$20, 캐시 읽기 $0.20) 기준으로 계산하면 다음과 같습니다.
| 모델 | 해결 수 | 이슈당 비용 | 합계 |
|---|---|---|---|
| 저가 티어 | 22 | $0.32 | $7.04 | 프리미엄 티어 | 26 | $0.61 | $15.86 |
프리미엄은 해결 수가 18% 많지만 총비용은 2.3배입니다. 40개짜리 백로그라면 $9가 더 듭니다. 같은 거래를 월 4,000개 이슈로 확장하면 $880이고, 그럼에도 처리량은 18%만 늘어납니다. 저가 티어가 명백히 잘못된 선택은 아닙니다. 해결률을 볼륨과 맞바꾸는 것이며, 정답은 놓친 이슈 하나의 비용이 1달러를 넘는지에 달려 있습니다.
계측해야 할 항목
- 시도당이 아니라 해결된 이슈당 비용. 분모는 요청 수가 아니라 병합된 PR 수입니다.
- 모델별 재시도 배율. 1.4x인 모델은 다른 것을 세기도 전에 정가의 3분의 1을 이미 더 쓰는 셈입니다.
- 디프에 나타나지 않는 계획 및 자기 검토 토큰까지 포함한 승인된 디프당 토큰 수.
- 사람이 리뷰하는 시간(분). 12% 저렴하지만 리뷰에 20% 더 오래 걸리는 모델은 더 비쌉니다.
결론
공개 벤치마크는 여러분의 백로그와 닮지 않은 과제로 역량을 순위 매깁니다. Real-SWE는 그 정직한 버전을 향한 초기 시도입니다. 자신의 저장소에서 직접 실행하기 전까지는 모든 모델 비교를 해결된 이슈당 비용에 관한 가설로 보고, 그 가설을 자신의 토큰 수로 가격 매기세요.
관련 글
이 내용을 현재 스택에 적용하고 싶으신가요? 공급업체 청구서, 게이트웨이 로그, 주요 워크플로를 가져오시면 비용 요인과 절감 경로를 정리해드립니다. 무료 감사 예약 →