İçeriğe geç

Real-SWE çözülen issue başına maliyet

Güncellendi September 27, 2026 · ilk yayın September 27, 2026

Real-SWE 12 Eylül 2026'da yayımlandı ve Hacker News'te 275 puan ve 158 yorum topladı. Önemli olan kısım, çoğu maliyet modelinin yanlış yaptığı noktadır: benchmark paketleri herkese açıktır, ezberlenmiştir ve agent'larınızın gerçekte dokunduğu kodu temsil etmez. Real-SWE, modelleri özel, gerçek dünya kurumsal depolarına karşı çalıştırır.

Maliyet sayısı neden skordan daha önemli

Herkese açık bir benchmark size geçme oranı verir. Maliyet vermez. Çözülen issue başına maliyet için aynı anda üç şey gerekir:

Bunları çarptığınızda bir bütçe kalemine karşılık gelen tek rakamı elde edersiniz. Lideri 4 puan geride bırakan ama issue'ları tek denemede ve üçte bir token ile çözen bir model, çözülen issue başına daha ucuzdur. Gerçek bir backlog'da bu fark, skor farkının gösterdiğinden daha hızlı birikir.

Herkese açık benchmark'lar kaliteyi neden abartır

Kurumsal kod tabanları, herkese açık benchmark varsayımlarını bozan özelliklere sahiptir: uzun iç kurallar, belgelenmemiş değişmezler, tarihsel kazaları kodlayan testler ve kimsenin tam olarak anlamadığı build sistemleri. Herkese açık bir repodaki kalıpları eşleştiren bir model, üç yıllık birikmiş kararlara sahip 400 dosyalık bir monorepo'da aynı başarıyı gösteremez. Bu ay geniş çapta tartışılan sonucun, 27B açık ağırlıklı bir yaratıcı yazarlık modelinin Fable 5 seviyesinde ve bildirilen 40 kat daha ucuz fiyatla çalışması olmasının nedeni de budur — açık ağırlıklar, API modellerinde bulunmayan yerel depo önbilgisiyle başlar.

Hesabı yapmak

40 issue'nun kapsamda olduğu gerçek bir backend deposu düşünün. Daha ucuz model, 60K girdi / 8K çıktı ile tek denemede 22 issue çözsün. Premium model ise 1.4x yeniden deneme çarpanı ve 90K girdi / 14K çıktı ile 26 issue çözsün. Opus 5.5 fiyatlarıyla ($4/$20, cache okumaları $0.20):

ModelÇözülenIssue başına maliyetToplam
Ekonomik kademe22$0.32$7.04
Premium kademe26$0.61$15.86

Premium, %18 daha fazla çözülen issue için toplamda 2.3x maliyet getiriyor. 40 issue'lık bir backlog'da bu $9 fark demektir. Aynı takas ayda 4,000 issue için $880 eder — ve yine de yalnızca %18 daha fazla verim satın alır. Ekonomik kademe açıkça yanlış değil; çözüm oranını hacim karşılığında takas ediyorsunuz ve doğru cevap, kaçırılan bir issue'nun bir dolardan fazla maliyetli olup olmadığına bağlıdır.

Neyi ölçmeli

  1. Deneme başına değil, çözülen issue başına maliyet. Payda birleştirilmiş PR'lardır, istekler değil.
  2. Model başına yeniden deneme çarpanı. 1.4x olan bir model, başka hiçbir şey saymadan liste fiyatının üçte biri kadar ek maliyet getirir.
  3. Kabul edilen diff başına token; diffin hiç göstermediği plan ve öz-inceleme tokenları dahil.
  4. İnsan inceleme dakikaları. %12 daha ucuz ama incelemesi %20 daha uzun süren bir model, daha pahalıdır.

Sonuç

Herkese açık benchmark'lar, yetenekleri backlog'unuza benzemeyen görevlerde sıralar. Real-SWE, dürüst versiyona yönelik erken bir denemedir. Kendi depolarınızda çalıştırana kadar her model karşılaştırmasını çözülen issue başına maliyet hipotezi olarak görün ve bu hipotezi kendi token sayılarınızla fiyatlandırın.

İlgili


Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →

finopsllm.com'a dön