Ajan iş akışlarında MCP araç tanımı token ek yükünü kontrol edin
Güncellendi September 19, 2026 · ilk yayın September 19, 2026
Bir AI ajanını birden çok Model Context Protocol (MCP) sunucusuna bağlamak, model kullanıcı niyetinin tek bir kelimesini okumadan önce her turda binlerce girdi token'ı ekler. Kayıtlı her araç; fonksiyon adları, parametre açıklamaları, enum tanımları ve tür kısıtları içeren bir JSON şeması ekler. 6 bağlı MCP sunucusu (GitHub, Postgres, Slack, Jira, Brave Search, Filesystem) bulunan kurumsal bir çalışma alanında bu araç önsözü, API çağrısı başına 4,500 ile 12,000 arasında girdi token'ı tüketir. Bir görev boyunca 30 turda bu statik ek yük, saf şema fazlalığı olarak $0.35 ila $1.20 tüketir.
MCP şema vergisinin yapısı
Model Context Protocol, LLM yetenekleri için standart bir istemci-sunucu JSON-RPC arayüzü tanımlar. Ancak dil modelleri, sistem isteminde ya da araç tanımı parametre bloğunda açık şema enjeksiyonu olmadan araçların kullanılabilirliğini çıkaramaz. Bir mühendis 24 şema inceleme ve SQL aracı içeren bir veritabanı MCP sunucusu bağladığında, dikkat mekanizmasının araç çağrılarını yönlendirebilmesi için tam JSON şeması her çıkarım turunda modele sunulmalıdır. Standart API faturalandırması her istekte toplam girdi token'larını ölçtüğü için, yönetilmeyen MCP araç kataloğu tüm ajan işlemlerinde anında ve doğrusal bir taban vergisi yaratır.
MCP araç tanımları neden bu kadar çok token harcar?
Her MCP araç tanımı ayrıntılı meta veri gerektirir: parametre adları, iç içe özellikler, insan tarafından okunabilir açıklamalar ve JSON Schema belirtim başlıkları. Tek bir ayrıntılı veritabanı sorgu aracı çoğu zaman 350 ile 600 token tüketir. Birden çok departman MCP sunucusuna yayılan düzinelerce araçta, başlangıç bağlam penceresi dinamik konuşma geçmişi yerine statik araç sözleşmeleriyle dolar.
MCP ek yükünü ortadan kaldırmanın üç mimarisi
Üretimdeki ajan filolarını işleten mühendislik ekipleri, araç token enflasyonunu kontrol etmek için üç ayrı azaltma stratejisi uygular:
- Prompt caching kesme noktaları: Statik MCP araç tanımlarını, istem yapısında dinamik konuşma geçmişinden önce yerleştirin ve araç bloğunun hemen ardına açık bir prompt caching kesme noktası koyun. 5 dakika ya da 1 saatlik önbellek TTL'lerini destekleyen Anthropic, OpenAI ve Google Gemini modellerinde, önbellek isabetleri ilk turdan sonra araç şemasının girdi token maliyetini %75 ila %90 azaltır.
- Dinamik iki aşamalı araç kaydı: Tüm MCP araçlarını genel olarak açmaktan kaçının. Hafif bir yönlendirici model ya da anlamsal dizin kullanarak kullanıcı isteminin gerektirdiği araç alanını belirleyin ve yalnızca ilgili 3–5 araç şemasını yürütme ajanının aktif yüküne dinamik olarak ekleyin.
- Şema sıkıştırma ve açıklama küçültme: Ayrıntılı biçimlendirmeyi kaldırın, JSON şema dizgileri içindeki markdown açıklamaları silin ve uzun alan açıklamalarını kompakt tür tanımlarıyla değiştirin. Agresif şema küçültme, araç seçim doğruluğunu düşürmeden araç tanımı yükünü genellikle %35 ila %50 azaltır.
Mühendislik ekipleri MCP araç token ek yükünü nasıl azaltabilir?
Ekipler; araç bildirimlerinden sonra prompt cache kesme noktaları koyarak, iki aşamalı anlamsal araç yönlendirmesi uygulayarak ve gereksiz JSON şeması özellik açıklamalarını küçülterek MCP ek yükünü azaltır.
Prompt caching MCP şema token maliyetini ortadan kaldırabilir mi?
Prompt caching, token işleme gecikmesini tamamen ortadan kaldıramaz; ancak ön ek önbelleklemeyi destekleyen modellerde, araç tanımı bloğu ardışık turlar boyunca aynı kaldığı sürece, tekrar eden araç tanımı token'larının faturalama maliyetini %90'a varan oranda düşürür.
İlgili
Bunu kendi altyapınıza uygulamak mı istiyorsunuz? Sağlayıcı faturalarını, ağ geçidi kayıtlarını ve ana iş akışlarını getirin; maliyet etkenlerini ve tasarruf yolunu çıkaralım. Ücretsiz denetim planlayın →