Langsung ke konten

Real-SWE: biaya per issue yang terselesaikan

Diperbarui September 27, 2026 · pertama terbit September 27, 2026

Real-SWE dirilis pada 12 September 2026 dan mendapat 275 poin serta 158 komentar di Hacker News. Premisnya adalah bagian yang paling sering keliru di model biaya mana pun: suite benchmark bersifat publik, sudah dihafal, dan tidak mewakili kode yang benar-benar disentuh agen Anda. Real-SWE menjalankan model pada repositori perusahaan yang privat dan nyata.

Mengapa angka biaya lebih penting daripada skor

Benchmark publik memberi Anda tingkat lulus. Ia tidak memberi Anda biaya. Biaya per issue yang terselesaikan membutuhkan tiga hal sekaligus:

Kalikan ketiganya dan Anda mendapatkan satu-satunya angka yang bisa dipetakan ke baris tagihan. Model yang skornya 4 poin di bawah pemimpin tetapi menyelesaikan issue dalam satu percobaan dengan sepertiga token jelas lebih murah per issue yang terselesaikan. Pada backlog nyata, selisih itu bertambah lebih cepat daripada yang disarankan oleh selisih skor.

Mengapa benchmark publik melebih-lebihkan kualitas

Basis kode perusahaan memiliki sifat-sifat yang merusak asumsi benchmark publik: konvensi internal yang panjang, invarian yang tidak terdokumentasi, tes yang menyimpan kecelakaan historis, dan sistem build yang tidak sepenuhnya dipahami siapa pun. Model yang mencocokkan pola pada repositori publik tidak bisa mencocokkan pola pada monorepo 400 file dengan tiga tahun keputusan yang menumpuk. Itulah sebabnya hasil yang banyak dibicarakan bulan ini, yaitu model penulisan kreatif open-weights 27B yang dilaporkan berkinerja setara Fable 5 dengan harga 40x lebih murah, penting. Open weights memulai dari prior repositori lokal yang tidak dimiliki model API.

Menjalankan hitungannya

Ambil repositori backend nyata yang memiliki 40 issue dalam cakupan. Misalkan model yang lebih murah menyelesaikan 22 issue dalam satu percobaan dengan 60K input / 8K output, dan model premium menyelesaikan 26 issue dengan pengali percobaan ulang 1,4x pada 90K input / 14K output. Dengan tarif Opus 5.5 ($4/$20, pembacaan cache $0,20):

ModelTerselesaikanBiaya per issueTotal
Tingkat murah22$0.32$7.04
Tingkat premium26$0.61$15.86

Premium menghabiskan 2,3x total untuk 18% lebih banyak issue yang terselesaikan. Pada backlog 40 issue, selisihnya $9 lebih mahal. Pertukaran yang sama pada 4.000 issue per bulan adalah $880 — dan tetap hanya membeli 18% throughput tambahan. Tingkat yang lebih murah tidak jelas salah; Anda sedang menukar tingkat penyelesaian dengan volume, dan jawaban yang tepat bergantung pada apakah satu issue yang terlewat lebih mahal daripada satu dolar.

Apa yang perlu diinstrumentasi

  1. Biaya per issue yang terselesaikan, bukan per percobaan. Penyebutnya adalah PR yang di-merge, bukan jumlah permintaan.
  2. Pengali percobaan ulang per model. Model dengan pengali 1,4x sudah berharga sepertiga dari harga daftarnya, sebelum Anda menghitung hal lain.
  3. Token per diff yang diterima, termasuk token rencana dan tinjauan mandiri yang tidak pernah muncul di diff.
  4. Menit tinjauan manusia. Model yang 12% lebih murah tetapi membutuhkan 20% lebih lama untuk ditinjau justru lebih mahal.

Kesimpulan

Benchmark publik memeringkat kemampuan pada tugas yang tidak menyerupai backlog Anda. Real-SWE adalah upaya awal menuju versi yang jujur. Sampai Anda menjalankannya pada repositori Anda sendiri, perlakukan setiap perbandingan model sebagai hipotesis biaya per issue yang terselesaikan, lalu hitung hipotesis itu dengan jumlah token Anda sendiri.

Terkait


Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →

Kembali ke finopsllm.com