Real-SWE çözülen issue başına maliyet
Güncellendi September 27, 2026 · ilk yayın September 27, 2026
Real-SWE 12 Eylül 2026'da yayımlandı ve Hacker News'te 275 puan ve 158 yorum topladı. Önemli olan kısım, çoğu maliyet modelinin yanlış yaptığı noktadır: benchmark paketleri herkese açıktır, ezberlenmiştir ve agent'larınızın gerçekte dokunduğu kodu temsil etmez. Real-SWE, modelleri özel, gerçek dünya kurumsal depolarına karşı çalıştırır.
Maliyet sayısı neden skordan daha önemli
Herkese açık bir benchmark size geçme oranı verir. Maliyet vermez. Çözülen issue başına maliyet için aynı anda üç şey gerekir:
- Zor, özel görevlerdeki geçme oranı.
- Başarısızlıklar dahil, deneme başına tüketilen token.
- Deneme sayısı — model yeniden deneme, plan revizyonu veya diff inceleyip yeniden düşünme döngüsüne ihtiyaç duydu mu?
Bunları çarptığınızda bir bütçe kalemine karşılık gelen tek rakamı elde edersiniz. Lideri 4 puan geride bırakan ama issue'ları tek denemede ve üçte bir token ile çözen bir model, çözülen issue başına daha ucuzdur. Gerçek bir backlog'da bu fark, skor farkının gösterdiğinden daha hızlı birikir.
Herkese açık benchmark'lar kaliteyi neden abartır
Kurumsal kod tabanları, herkese açık benchmark varsayımlarını bozan özelliklere sahiptir: uzun iç kurallar, belgelenmemiş değişmezler, tarihsel kazaları kodlayan testler ve kimsenin tam olarak anlamadığı build sistemleri. Herkese açık bir repodaki kalıpları eşleştiren bir model, üç yıllık birikmiş kararlara sahip 400 dosyalık bir monorepo'da aynı başarıyı gösteremez. Bu ay geniş çapta tartışılan sonucun, 27B açık ağırlıklı bir yaratıcı yazarlık modelinin Fable 5 seviyesinde ve bildirilen 40 kat daha ucuz fiyatla çalışması olmasının nedeni de budur — açık ağırlıklar, API modellerinde bulunmayan yerel depo önbilgisiyle başlar.
Hesabı yapmak
40 issue'nun kapsamda olduğu gerçek bir backend deposu düşünün. Daha ucuz model, 60K girdi / 8K çıktı ile tek denemede 22 issue çözsün. Premium model ise 1.4x yeniden deneme çarpanı ve 90K girdi / 14K çıktı ile 26 issue çözsün. Opus 5.5 fiyatlarıyla ($4/$20, cache okumaları $0.20):
| Model | Çözülen | Issue başına maliyet | Toplam |
|---|---|---|---|
| Ekonomik kademe | 22 | $0.32 | $7.04 | Premium kademe | 26 | $0.61 | $15.86 |
Premium, %18 daha fazla çözülen issue için toplamda 2.3x maliyet getiriyor. 40 issue'lık bir backlog'da bu $9 fark demektir. Aynı takas ayda 4,000 issue için $880 eder — ve yine de yalnızca %18 daha fazla verim satın alır. Ekonomik kademe açıkça yanlış değil; çözüm oranını hacim karşılığında takas ediyorsunuz ve doğru cevap, kaçırılan bir issue'nun bir dolardan fazla maliyetli olup olmadığına bağlıdır.
Neyi ölçmeli
- Deneme başına değil, çözülen issue başına maliyet. Payda birleştirilmiş PR'lardır, istekler değil.
- Model başına yeniden deneme çarpanı. 1.4x olan bir model, başka hiçbir şey saymadan liste fiyatının üçte biri kadar ek maliyet getirir.
- Kabul edilen diff başına token; diffin hiç göstermediği plan ve öz-inceleme tokenları dahil.
- İnsan inceleme dakikaları. %12 daha ucuz ama incelemesi %20 daha uzun süren bir model, daha pahalıdır.
Sonuç
Herkese açık benchmark'lar, yetenekleri backlog'unuza benzemeyen görevlerde sıralar. Real-SWE, dürüst versiyona yönelik erken bir denemedir. Kendi depolarınızda çalıştırana kadar her model karşılaştırmasını çözülen issue başına maliyet hipotezi olarak görün ve bu hipotezi kendi token sayılarınızla fiyatlandırın.
İlgili
- Görev başına gerçek maliyet: öncü modeller
- Başarılı görev başına maliyet
- Yoğun agentic kodlama maliyeti: Claude ve Qwen
- Evals maliyet kontrolü
- Açık ağırlıklı bir modeli fiyatlandırmak
Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →