Quick answer: Het koppelen van een AI-agent aan meerdere Model Context Protocol (MCP) servers injecteert duizenden input-tokens bij elke interactieronde voordat het model ook maar één letter van de gebruikersprompt...

Beperk token-overhead van MCP-tooldefinities

Updated September 19, 2026 · first published September 19, 2026

Het koppelen van een AI-agent aan meerdere Model Context Protocol (MCP) servers injecteert duizenden input-tokens bij elke interactieronde voordat het model ook maar één letter van de gebruikersprompt heeft verwerkt. Elk geregistreerd gereedschap voegt een JSON-schema toe met functienamen, parameterbeschrijvingen en typebeperkingen. In een zakelijke werkomgeving met 6 actieve MCP-servers (GitHub, Postgres, Slack, Jira, web search, bestandssysteem) verbruikt deze statische preamble 4.500 tot 12.000 input-tokens per API-aanroep. Bij een multi-turn taak van 30 interacties verspilt deze redundante overhead $0,35 tot $1,20 per sessie.

Drie architecturen om MCP-overhead te elimineren

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research