İçeriğe geç

Uyarlanabilir düşünme ve maliyet tahmini

Güncellendi September 1, 2026 · ilk yayın September 1, 2026

Kısa yanıt: Akıl yürütme bütçesi eskiden sizin belirlediğiniz bir sayıydı. thinking: {type: "enabled", budget_tokens: N} gönderiyordunuz ve N hem bir kontrol hem de bir tahmindi: en kötü durumda her...

Akıl yürütme bütçesi eskiden sizin belirlediğiniz bir sayıydı. thinking: {type: "enabled", budget_tokens: N} gönderiyordunuz ve N hem bir kontrol hem de bir tahmindi: en kötü durumda her istek N akıl yürütme tokenına mal oluyordu ve finans ekibi bunu çarpabilirdi.

Bu parametre Opus 4.6 ve Sonnet 4.6 üzerinde kullanımdan kaldırıldı. En yeni modellerde — Fable 5 ve 5.1, Sonnet 5, Opus 5, 4.8 ve 4.7 — gönderildiğinde 400 döndürüyor. Yerine thinking: {type: "adaptive"} geliyor; model isteğin zorluğuna göre ne kadar düşüneceğine kendisi karar veriyor.

Bu, ortalamada dolar başına daha iyi çıktı demek. Ancak bir tavanın kaldırılması anlamına da geliyor. Tahmininiz o tavana dayanıyorduysa, tahmin ay kapanana kadar görünmeyecek bir biçimde yanlış.

Sayılarda ne değişiyor

İstek başına ortalama maliyet genellikle düşer; çünkü kolay istekler artık ihtiyaç duymadıkları akıl yürütmenin bedelini ödemez. Varyans artar, çünkü zor istekler artık tavanınızda kesilmez. Bu iki değer ters yönde hareket eder ve istek başına maksimum olarak ifade edilen bir bütçenin tutunacak bir yeri kalmaz.

Pratik hata ortalamada değil, kuyruktadır: bir prompt değişikliği, yeni bir belge türü ya da daha zor sorular sormaya başlayan bir kullanıcı, trafiğinizin bir dilimini daha derin akıl yürütmeye taşır ve yapılandırmanızda bunu sınırlayan hiçbir şey yoktur.

Tavanı değil, dağılımı tahmin edin

Üç değişiklik var; size sağladıkları değere göre sıralı.

Akıl yürütme tokenlarını ayrı bir seri olarak izleyin. Zaten her yanıttaki usage nesnesinde bulunuyorlar. Bunları telemetride girdi ve çıktıdan ayırın; kaymayı ay sonunda değil, olduğu gün görebilirsiniz.

Bütçeyi yüzdelik dilimlere göre yapın. "İstek başına N token" yerine route başına bir p50 ve bir p99 koyun. p50 iş yükünün maliyetini gösterir; p50 ile p99 arasındaki fark ise kötü bir haftaya ne kadar açık olduğunuzu gösterir.

Toplam yerine orana göre uyarı kurun. Route başına toplam tokenlar içindeki akıl yürütme tokenlarının payı, bir prompt değişikliği modeli daha fazla çalıştırdığında ilk hareket eden tek sayıdır. Toplam harcama uyarısı ise hacim birikip günler sonra tetiklenir.

Limitin hâlâ yeri olduğu yer

İstek başına ayarı kaldırmak, tüm limitleri kaldırmak anlamına gelmez. Route düzeyindeki ve kiracı düzeyindeki harcama limitleri hâlâ çalışır, kontrolden çıkan döngüleri yakalar ve güvenlik sınırı artık orada olmalı — sahip olduğunuz sınırda, artık var olmayan bir istek parametresinin içinde değil. Derin akıl yürütmenin hiçbir zaman değmediği gecikmeye duyarlı yollarda kaldıraç token bütçesi değil, model seçimidir.

İlgili

İlgili


Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →

finopsllm.com'a dön