OpenAI faturanızın arkasındaki önbellek kaçırması
Güncellendi September 26, 2026 · ilk yayın September 26, 2026
Bir prompt önbellek paneli, yeniden kullanım oranının düştüğünü söyleyebilir. Ancak tek başına hangi istek değişikliğinin düşüşe yol açtığını ya da bunun ne kadara mal olduğunu söyleyemez. OpenAI'nin 8 Eylül 2026 sürümü, GPT-5.6 ve sonraki desteklenen modeller için Responses API'de Prompt Cache Diagnostics özelliğini genel kullanıma sundu. FinOps açısından faydalı adım, önbellekteki token sayısındaki düşüşü kısa ve tekrarlanabilir bir incelemeye dönüştürmektir.
Kaçırılan isteği karşılaştırın
Ön ekinin yeniden kullanılmasını beklediğiniz, yakın zamanda tamamlanmış bir yanıtın ID'sini kaydedin. Aynı kuruluştan gelen bir sonraki karşılaştırılabilir Responses API isteğinde prompt_cache_options.comparison_response_id alanını bu ID ile ayarlayın. Ardından yeni yanıttaki prompt_cache_diagnostics değerini, usage.input_tokens_details.cached_tokens ile birlikte okuyun. Karşılaştırma seçeneği bir tanılama talep eder; önceki konuşmayı yüklemez ve önbellek davranışını değiştirmez. OpenAI'nin tanılama kılavuzu çalışan istek örneklerini içerir.
const next = await client.responses.create({
model: model,
instructions: stableInstructions,
input: nextInput,
tools: stableTools,
prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);Snippet, baseline değişkeninin yakın zamanda tamamlanmış bir yanıt olduğunu ve diğer değişkenlerin kendi istek verileriniz olduğunu varsayar. Önbelleğe alınabilecek kadar uzun, sabit bir ön ek tutun: OpenAI, GPT-5.6 ve sonrası için 1,024 token minimumu belgeler. Küçük veya kökten farklı bir prompt, anlamlı bir önbellek kaçırma testi değildir.
Metriği değil, nedeni düzeltin
Bir cache_miss sonucu; değişen model, servis katmanı, araç tanımları veya sıralamaları, önbellek anahtarı, yanıt biçimi, akıl yürütme çabası, ayrıntı düzeyi ya da sıkıştırılmış bağlama işaret edebilir. Örneğin zararsız görünen bir araç şemasının yeniden adlandırılması, yeniden kullanılabilir ön eki geçersiz kılabilir. İstek yapılandırmasını ve prompt'un ilk baytlarını karşılaştırın; değişiklik kazara yapıldıysa kararlılığı geri getirin ve karşılaştırmayı aynı referansa karşı yeniden çalıştırın. OpenAI bulduğu ilk nedeni bildirir, bu yüzden ilk düzeltmeden sonra başka bir neden ortaya çıkabilir.
Değişiklik bilinçli yapıldıysa isabet zorlamayın. Farklı bir model, önbellek yeniden kullanımını kaybetse bile toplam görev maliyetini düşürebilir; sıkıştırma gelecekteki bağlamı azaltabilir. Yalnızca önbellek isabet yüzdesine değil, bütün isteğe ve göreve bakın. Süresi dolmuş bir referans ya da unavailable sonucu sonuçsuz bir testtir; önbelleğin başarısız olduğunun kanıtı değildir.
Bulguyu paraya çevirin
cache_missed_tokens, karşılaştırma yanıtına göre kaybedilen yeniden kullanılabilir token sayısını tahmin eder. Bu, faturalanan token sayısı değildir. Benzer şekilde cache_hit sonucu da dolar cinsinden tasarrufu kanıtlamaz. Gerçekleşen girdi maliyeti için her yanıtın toplam input_tokens, cached_tokens ve cache_write_tokens değerlerini toplayın, ardından o model ve işleme katmanı için güncel fiyatı uygulayın. GPT-5.6 ve sonrası için OpenAI'nin prompt önbellekleme kılavuzu, önbellek okumalarının önbelleksiz girdi fiyatının 0.1 katı, önbellek yazmalarının ise bu fiyatın 1.25 katı olduğunu belirtir.
ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000Bunlar birbirini dışlayan token kategorileridir: yazma fiyatıyla zaten sayılmış tokenlara ayrıca önbellek yazma ek ücreti eklemeyin. Bu formül yalnızca girdiyi kapsar; başarılı görev başına maliyeti hesaplarken çıktıyı, araçları, yeniden denemeleri ve diğer ücretleri de ekleyin. Bu makaledeki sabit fiyat yerine sağlayıcının güncel fiyat tablosunu kullanın.
Yararlı bir haftalık kontrol
- Karşılaştırılabilir trafiği iş yükü, model ve servis katmanına göre gruplayın; önbelleğe alınmış token payını ve tamamlanan görev başına girdi maliyetini grafikleştirin.
- Ani bir gerilemeden örnek alın, yakın zamanlı bir referansla karşılaştırın ve tanılama nedenini ile sorumlu kod değişikliğini kaydedin.
- Kazara ön ek veya yapılandırma sapmasını düzeltin; görevin toplam ekonomisi iyileşiyorsa bilinçli kalite ya da yönlendirme değişikliklerini koruyun.
- Sonucu temsili üretim trafiğinde doğrulayın ve gözlenen tasarrufu faturalamayla uzlaştırın.
Tanılamaların kendisinin ek bir özellik ücreti yoktur, ancak ek test istekleri normal şekilde faturalandırılır. Kazanç, daha güzel bir isabet oranı grafiği değildir. Belirli bir iş yükünün girdi maliyetinin neden değiştiğine ve önerilen düzeltmenin faturayı gerçekten düşürüp düşürmediğine dair savunulabilir bir açıklamadır.
Ekiplerin sorduğu sorular
Bir önbellek isabeti tanısı, bir isteğin daha ucuz olduğunu kanıtlar mı?
Hayır. Yalnızca seçilen referansa göre bir kaçırma tespit edilmediğini gösterir. Tasarruf iddiasında bulunmadan önce gerçek cached_tokens değerlerini ve isteğin fiyatlandırılmış token kategorilerini kontrol edin.
Tanılamalar herhangi iki OpenAI isteğini karşılaştırabilir mi?
Hayır. Aynı kuruluşa ait, yakın zamanda tamamlanmış bir referans kullanın ve bu akışı yalnızca GPT-5.6 ve sonrası desteklenen Responses API modellerinde bekleyin. Karşılaştırma kaydının süresi dolabilir.
Her önbellek kaçırması giderilmeli mi?
Hayır. Model değişikliği, farklı bir servis katmanı veya sıkıştırılmış bağlam bilinçli olabilir. Değişikliği geri almadan önce kalite, gecikme ve başarılı görev başına maliyeti karşılaştırın.
İlgili
Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →