İçeriğe geç

Sessiz model düşürmeleri ve maliyet modelleri

Güncellendi September 27, 2026 · ilk yayın September 27, 2026

23 Eylül 2026'da r/GroundTruthAINews'taki bir başlık, Anthropic'in Opus 5.5 lansman notlarında gömülü bir dipnota dikkat çekti: bir Opus 5.5 isteği Opus 4.8 tarafından yanıtlanabilir. Anthropic ve OpenAI aynı öğleden sonra fiyat indirimi duyurdu. İki laboratuvar da aynı fikri satıyordu: yeteneği koru, çok daha az harca. FinOps açısından önemli olan kısım bu dipnottur.

Gerçekte ne oldu

Claude Opus 5.5, milyon token başına $4/$20 fiyatla, Opus 5'ten yaklaşık %20 ucuz olarak piyasaya çıktı; önbellek okumaları %60 düşürülerek $0.20 oldu. Anthropic, görev başına daha az token ve %30 daha hızlı çıktının tipik iş yüklerini yaklaşık %40 ucuzlattığını söylüyor. Yaklaşık 90 dakika sonra OpenAI, GPT-6 Sol'u $2/$10, Luna'yı ise $0.10/$0.50 fiyatla duyurdu; ikisi de GPT-5.6 fiyatlarının yarısı.

Bu dönemdeki her lansman yazısı aynı türden bir dipnot taşıyor: çağırdığınız uç nokta bir takma ad'dır ve bu takma ad bir geçiş penceresi boyunca birden fazla model sürümüne yük dağıtılarak yönlendirilir. Bu normal bir kapasite uygulamasıdır. Ancak maliyet modellemesi açısından bir sorundur.

Rakamları neden bozar

Takas nasıl tespit edilir

Tüm büyük sağlayıcılar, yanıt gövdesinde çözümlenmiş modeli döndürür. Bunu kaydedin. Bir alan, dört satır kod:

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

Ardından her maliyet metriğini, istediğiniz modele göre değil, çözümlenmiş modele göre bölün. Bir grup kaymaya başladığı anda cevabınız vardır: takma ad sürümleri karıştırıyor ve görev başına maliyetiniz, iki farklı ürünün ağırlıklı ortalamasıdır.

Bütçe etkisi

Bir geçiş sırasında manşet rakama değil, karışık maliyete göre planlayın. Çağrıların %20'si daha eski bir modele düşerse, etkin giriş fiyatınız milyon başına $4.00 olmaz; karışımın ürettiği ne ise o olur. Aynı mantık duyurulan tasarruf için de geçerlidir: „%40 daha ucuz” iddiası, token sayısında bir azalma varsayan tipik bir iş yükü ortalamasıdır. Daha ucuz ama eski model daha uzun yanıtlar üretiyorsa, bu varsayım tutmayabilir.

Uyulması gereken kurallar

  1. Hiçbir zaman bir takma ad üzerinden modellemeyin. Bütçelediğiniz ya da değerlendirdiğiniz her şey için tarihli bir model kimliği sabitleyin.
  2. Her istekte çözümlenmiş modeli kaydedin. Bir değerlendirmeyi yeniden çalıştırma ihtimaliniz varsa bu pazarlık konusu değildir.
  3. Geçiş penceresinden sonra referansı yeniden alın. Tipik süre haftalardır, çeyreklerle ölçülmez; yine de doğrulayın.
  4. Bir geçişi karışım olarak fiyatlandırın. Sağlayıcınızdan beklenen dağılımı isteyin ya da ölçün.

Sonuç

Bir fiyat indirimi ile sessiz bir düşürme aynı öğleden sonra gelebilir. İndirim manşettir; düşürme ise geçen ayki tahmini sessizce geçersiz kılan dipnottur. Çözümlenmiş modeli kaydedin, tarihli kimlikleri sabitleyin ve karışımı fiyatlandırın.

İlgili


Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →

finopsllm.com'a dön