Real-SWEの解決済みissueあたりコスト
更新日 September 27, 2026 · 初回公開 September 27, 2026
Real-SWEは2026年9月12日に公開され、Hacker Newsで275ポイント、158コメントを集めました。その前提は、多くのコストモデルが見誤る部分です。ベンチマークスイートは公開されており、記憶されていて、エージェントが実際に触れるコードを代表していません。Real-SWEは、非公開の実在するエンタープライズリポジトリに対してモデルを実行します。
スコアよりコストの数字が重要な理由
公開ベンチマークから得られるのは合格率です。コストは得られません。解決済みissueあたりのコストには、次の3つが同時に必要です。
- 難しい非公開タスクでの合格率。
- 失敗を含む、1回の試行あたりの消費トークン数。
- 試行回数—モデルは再試行、計画の修正、差分を見直して考え直すループを必要としましたか。
これらを掛け合わせると、費用項目に対応する唯一の数字が得られます。スコアがトップより4ポイント低くても、1回の試行で、3分の1のトークンでissueを解決するモデルは、解決済みissueあたりでは安くなります。実際のバックログでは、その差はスコア差が示唆するより速く積み上がります。
公開ベンチマークが品質を過大評価する理由
エンタープライズのコードベースには、公開ベンチマークの前提を崩す性質があります。長い社内規約、文書化されていない不変条件、過去の偶然を符号化したテスト、誰も完全には理解していないビルドシステムです。公開リポジトリでパターンを当てられるモデルでも、3年分の意思決定が積み重なった400ファイルのモノレポでは当てられません。だから今月広く議論された結果は、27Bのオープンウェイトの創作文章モデルがFable 5水準で動作し、価格は報告によれば40x安い、というものでした—オープンウェイトは、APIモデルにはないローカルリポジトリの事前知識から出発します。
計算してみる
対象のissueが40件ある実際のバックエンドリポジトリを考えます。安いモデルは入力60K / 出力8Kで、1回の試行で22件を解決し、プレミアムモデルは再試行倍率1.4x、入力90K / 出力14Kで26件を解決するとします。Opus 5.5の料金($4/$20、キャッシュ読み取り$0.20)では次のようになります。
| モデル | 解決数 | issueあたりコスト | 合計 |
|---|---|---|---|
| 低価格帯 | 22 | $0.32 | $7.04 | プレミアム帯 | 26 | $0.61 | $15.86 |
プレミアムは、解決数が18%増えるのに対し、合計コストは2.3xです。40件のバックログなら、差額は$9です。同じトレードオフを月4,000件で行うと$880になり—それでも得られるスループットは18%増えるだけです。低価格帯が明らかに間違いとは言えません。解決率とボリュームを交換しているのであり、正しい答えは、解決できなかったissue1件のコストが1ドルを超えるかどうかで決まります。
計測すべきこと
- 試行あたりではなく、解決済みissueあたりのコスト。分母はリクエストではなく、マージされたPRです。
- モデルごとの再試行倍率。1.4xのモデルは、他に何も数える前の時点で、定価の3分の1に相当します。
- 差分に現れない計画やセルフレビューのトークンを含む、承認された差分あたりのトークン数。
- 人間のレビュー時間(分)。12%安くてもレビューに20%長くかかるモデルは、かえって高くつきます。
まとめ
公開ベンチマークは、あなたのバックログとは似ていないタスクで能力を順位付けします。Real-SWEは、その誠実な版を目指す初期の試みです。自社のリポジトリで実行するまでは、あらゆるモデル比較を解決済みissueあたりコストの仮説として扱い、自社のトークン数でその仮説の価格を見積もってください。
関連記事
この方法を自社の環境にも適用しますか? プロバイダーの請求書、ゲートウェイログ、主要なワークフローをお持ちください。コスト要因と削減策を整理します。 無料監査を予約 →