İçeriğe geç

Sunucu araçları ayrı bir faturadır

Güncellendi September 1, 2026 · ilk yayın September 1, 2026

Kısa yanıt: Çoğu LLM maliyet modelinin tek bir sayacı vardır: giriş tokenı, çıkış tokenı, milyon başına fiyat. Bu model, bir isteğin yalnızca metin ürettiği dönemde doğruydu. Sunucu tarafı araçlar devreye...

Çoğu LLM maliyet modelinin tek bir sayacı vardır: giriş tokenı, çıkış tokenı, milyon başına fiyat. Bu model, bir isteğin yalnızca metin ürettiği dönemde doğruydu. Sunucu tarafı araçlar devreye girdiğinde doğruluğunu yitirdi.

Web araması, web fetch ve kod çalıştırma sağlayıcının altyapısında çalışır ve bunlardan birkaçı, ürettikleri tokenların üzerine kendi kullanım başına ücretini ekler. Tek bir agent turu bu yüzden sizden iki kez ücret alabilir: yaptığı aramalar için bir kez, bu sonuçların bağlama eklediği tokenlar için bir kez.

Birikimli kısım

İnsanların gözden kaçırdığı ikinci ücret budur. Her araç sonucu konuşmaya eklenir ve sonraki her tur tüm konuşmayı yeniden girdi olarak gönderir. Uzun bir agent çalışmasının başındaki on arama on ücret değil — on ücret artı, bu sonuç içeriklerinin sonraki her turda yeniden okunmasıdır.

Token hesabı doğrusal olması gerektiğini söylerken agent maliyetlerinin doğrusal olmayan görünmesinin nedeni budur. Kullanım başına ücret görünen kısımdır; bunun yol açtığı bağlam büyümesi daha büyük kısımdır ve etiketsiz biçimde girdi tokenı satırınıza yansır.

Atfetmezseniz yönetemezsiniz

Her istekte araç çağrılarını usage nesnesinin yanında kaydedin: hangi araç, kaç çağrı ve her sonucun bağlama eklediği token boyutu. Birikimi görünür kılan son alan budur ve varsayılan olarak kimse kaydetmez.

Ardından maliyeti API çağrısı başına değil, agent çalışması başına hesaplayın. Çalışma, kullanıcının gerçekte tetiklediği şeydir; API çağrısı ise o çalışmanın yaptığı yirmi şeyden biridir. Bütçe ya da birim ekonomisi rakamını çağrıya değil çalışmaya bağlarsanız, sonuç sizi olduğundan iyi gösterecek yönde yanlış olur.

Gerçekten işe yarayan üç kontrol

Çalışma başına araç çağrısını sınırlayın. Kullanıcı isteği başına arama ya da fetch için sert bir limit, iki ücreti birden sınırlar. Limite takılan çoğu iş yükü araştırma değil, döngü yapıyordu.

Bağlama giren içeriği kısaltın. Getirilen bir sayfanın tamamına nadiren ihtiyaç duyarsınız. Eklemeden önce sonucu özetlemek ya da kırpmak, yalnızca mevcut turu değil sonraki tüm turları azaltır.

Sabit öneki önbelleğe alın. Sistem promptu ve araç tanımları bir çalışma boyunca değişmiyorsa — ki genellikle değişmez — prompt önbellekleme, araçların yarattığı en büyük tekrarlı maliyeti ortadan kaldırır.

Bunları modellemeden önce sağlayıcınızın güncel fiyat listesini kontrol edin: hangi araçların kullanım başına ücretlendirildiği ve oranın ne olduğu araçtan araca değişir ve zamanla güncellenir. Yapısal nokta yine geçerlidir: token sayacı artık tüm fatura değildir.

İlgili

İlgili


Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →

finopsllm.com'a dön