Sessiz model düşürmeleri ve maliyet modelleri
Güncellendi September 27, 2026 · ilk yayın September 27, 2026
23 Eylül 2026'da r/GroundTruthAINews'taki bir başlık, Anthropic'in Opus 5.5 lansman notlarında gömülü bir dipnota dikkat çekti: bir Opus 5.5 isteği Opus 4.8 tarafından yanıtlanabilir. Anthropic ve OpenAI aynı öğleden sonra fiyat indirimi duyurdu. İki laboratuvar da aynı fikri satıyordu: yeteneği koru, çok daha az harca. FinOps açısından önemli olan kısım bu dipnottur.
Gerçekte ne oldu
Claude Opus 5.5, milyon token başına $4/$20 fiyatla, Opus 5'ten yaklaşık %20 ucuz olarak piyasaya çıktı; önbellek okumaları %60 düşürülerek $0.20 oldu. Anthropic, görev başına daha az token ve %30 daha hızlı çıktının tipik iş yüklerini yaklaşık %40 ucuzlattığını söylüyor. Yaklaşık 90 dakika sonra OpenAI, GPT-6 Sol'u $2/$10, Luna'yı ise $0.10/$0.50 fiyatla duyurdu; ikisi de GPT-5.6 fiyatlarının yarısı.
Bu dönemdeki her lansman yazısı aynı türden bir dipnot taşıyor: çağırdığınız uç nokta bir takma ad'dır ve bu takma ad bir geçiş penceresi boyunca birden fazla model sürümüne yük dağıtılarak yönlendirilir. Bu normal bir kapasite uygulamasıdır. Ancak maliyet modellemesi açısından bir sorundur.
Rakamları neden bozar
- Görev başına maliyet kayar. Tahmininiz Opus 5.5 çıktı fiyatını varsayıyordu. Çağrıların bir kısmı 4.8'e düşerse hem birim fiyat hem de token sayısı ters yönlerde hareket eder.
- Değerlendirmeler bir karışımı ölçer. Bir geçiş penceresi sırasında çalıştırılan bir değerlendirme paketi, sürümlerin karışımını puanlar. Bu puan sonradan yeniden üretilemez.
- Fiyat indirimleri yanlış atfedilir. %40'lık bir tasarruf %15 gibi görünüyorsa, fark çoğunlukla bozuk bir optimizasyondan değil, sürüm karışımından gelir.
- Gecikme referansları eskir. 4.8, 5.5 kadar hızlı değildir. Geçiş ortasında yakaladığınız herhangi bir p50, kararlı durumdaki p50'niz değildir.
Takas nasıl tespit edilir
Tüm büyük sağlayıcılar, yanıt gövdesinde çözümlenmiş modeli döndürür. Bunu kaydedin. Bir alan, dört satır kod:
resolved = response.model # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKSArdından her maliyet metriğini, istediğiniz modele göre değil, çözümlenmiş modele göre bölün. Bir grup kaymaya başladığı anda cevabınız vardır: takma ad sürümleri karıştırıyor ve görev başına maliyetiniz, iki farklı ürünün ağırlıklı ortalamasıdır.
Bütçe etkisi
Bir geçiş sırasında manşet rakama değil, karışık maliyete göre planlayın. Çağrıların %20'si daha eski bir modele düşerse, etkin giriş fiyatınız milyon başına $4.00 olmaz; karışımın ürettiği ne ise o olur. Aynı mantık duyurulan tasarruf için de geçerlidir: „%40 daha ucuz” iddiası, token sayısında bir azalma varsayan tipik bir iş yükü ortalamasıdır. Daha ucuz ama eski model daha uzun yanıtlar üretiyorsa, bu varsayım tutmayabilir.
Uyulması gereken kurallar
- Hiçbir zaman bir takma ad üzerinden modellemeyin. Bütçelediğiniz ya da değerlendirdiğiniz her şey için tarihli bir model kimliği sabitleyin.
- Her istekte çözümlenmiş modeli kaydedin. Bir değerlendirmeyi yeniden çalıştırma ihtimaliniz varsa bu pazarlık konusu değildir.
- Geçiş penceresinden sonra referansı yeniden alın. Tipik süre haftalardır, çeyreklerle ölçülmez; yine de doğrulayın.
- Bir geçişi karışım olarak fiyatlandırın. Sağlayıcınızdan beklenen dağılımı isteyin ya da ölçün.
Sonuç
Bir fiyat indirimi ile sessiz bir düşürme aynı öğleden sonra gelebilir. İndirim manşettir; düşürme ise geçen ayki tahmini sessizce geçersiz kılan dipnottur. Çözümlenmiş modeli kaydedin, tarihli kimlikleri sabitleyin ve karışımı fiyatlandırın.
İlgili
- Claude Opus 5.5 maliyet modeli
- GPT-6 fiyatlandırması: Sol, Luna, Astra
- Model fiyat indirimleri ve yönlendirme bütçeleri
- Sağlayıcı fiyatları karşılaştırılamaz
- Değerlendirmelerde maliyet kontrolü
Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →