Kendalikan overhead token definisi tool MCP dalam alur kerja agen
Diperbarui September 19, 2026 · pertama terbit September 19, 2026
Menghubungkan agen AI ke beberapa server Model Context Protocol (MCP) menyuntikkan ribuan token input di setiap giliran, sebelum model membaca satu kata pun dari maksud pengguna. Setiap tool yang terdaftar menambahkan skema JSON yang berisi nama fungsi, deskripsi parameter, definisi enum, dan batasan tipe. Di ruang kerja perusahaan dengan 6 server MCP yang terhubung (GitHub, Postgres, Slack, Jira, Brave Search, Filesystem), pembukaan tool ini memakan 4.500 hingga 12.000 token input per panggilan API. Pada 30 giliran dalam satu tugas, overhead statis itu menghabiskan $0,35 hingga $1,20 hanya untuk redundansi skema.
Anatomi beban skema MCP
Model Context Protocol menetapkan antarmuka JSON-RPC standar antara klien dan server untuk kemampuan LLM. Namun, model bahasa tidak bisa menyimpulkan ketersediaan tool tanpa penyuntikan skema yang eksplisit, baik di system prompt maupun di blok parameter definisi tool. Ketika engineer menghubungkan server MCP database dengan 24 tool inspeksi skema dan SQL, skema JSON lengkap harus disajikan ke model pada setiap giliran inferensi agar mekanisme attention dapat merutekan pemanggilan tool. Karena penagihan API standar menghitung seluruh token input di setiap permintaan, katalog tool yang tidak dikelola menciptakan beban dasar yang langsung dan linier di semua operasi agen.
Mengapa definisi tool server MCP memakan begitu banyak token?
Setiap definisi tool MCP membutuhkan metadata yang panjang: nama parameter, properti bertingkat, deskripsi yang bisa dibaca manusia, dan header spesifikasi JSON Schema. Satu tool kueri database yang terperinci sering memakan 350 hingga 600 token. Di puluhan tool yang tersebar di beberapa server MCP departemen, jendela konteks awal terisi oleh kontrak tool statis, bukan riwayat percakapan yang dinamis.
Tiga arsitektur untuk menghilangkan overhead MCP
Tim engineering yang menjalankan armada agen produksi menerapkan tiga strategi mitigasi untuk mengendalikan inflasi token tool:
- Breakpoint prompt caching: Letakkan definisi tool MCP yang statis sebelum riwayat percakapan dinamis dalam struktur prompt, dan pasang breakpoint prompt caching secara eksplisit tepat setelah blok tool. Pada Anthropic, OpenAI, dan Google Gemini yang mendukung TTL cache 5 menit atau 1 jam, cache hit menurunkan biaya token input skema tool sebesar 75% hingga 90% setelah giliran pertama.
- Pendaftaran tool dua tahap dinamis: Hindari mengekspos semua tool MCP secara global. Gunakan model router ringan atau indeks semantik untuk mengidentifikasi domain tool spesifik yang dibutuhkan prompt pengguna, lalu injeksikan secara dinamis hanya 3 hingga 5 skema tool yang relevan ke payload agen eksekusi.
- Kompresi skema dan minifikasi deskripsi: Hapus format yang bertele-tele, hilangkan deskripsi markdown di dalam string JSON Schema, dan ganti penjelasan field yang panjang dengan definisi tipe yang ringkas. Minifikasi skema yang agresif biasanya memangkas volume payload definisi tool sebesar 35% hingga 50% tanpa menurunkan akurasi pemilihan tool.
Bagaimana tim engineering bisa mengurangi overhead token tool MCP?
Tim mengurangi overhead MCP dengan memasang breakpoint prompt cache setelah deklarasi tool, menerapkan perutean tool semantik dua tahap, dan memperkecil deskripsi properti JSON Schema yang berlebihan.
Bisakah prompt caching menghilangkan biaya token skema MCP?
Prompt caching memang tidak sepenuhnya menghilangkan latensi pemrosesan token, tetapi biaya penagihan token definisi tool yang berulang bisa turun hingga 90% pada model yang mendukung prefix caching, selama blok definisi tool tetap sama di giliran-giliran berikutnya.
Terkait
Ingin menerapkannya pada stack Anda? Bawa tagihan penyedia, log gateway, dan alur kerja utama; kami akan memetakan pendorong biaya dan jalur penghematan. Pesan audit gratis →