控制智能体MCP工具定义造成的Token冗余税
Updated September 19, 2026 · first published September 19, 2026
将AI智能体接入多个模型上下文协议(Model Context Protocol, MCP)服务器时,模型在阅读用户意图的首个字符前,每轮交互都会被迫吞下数千个输入Token。每个注册的工具都会附加包含函数名称、参数描述、枚举定义和类型约束的完整JSON Schema。在连接了6个MCP服务(GitHub、Postgres、Slack、Jira、Brave搜索、本地文件系统)的企业工作区中,静态工具前言在每次API调用中就吃掉4,500到12,000个输入Token。在一次30轮的典型任务中,仅模式重复传输就会产生0.35至1.20美元的纯冗余支出。
消除MCP开销的三大架构防线
- 提示词缓存断点(Prompt Caching Breakpoints):在Prompt上下文中将静态MCP工具定义置于所有动态历史记录之前,并在工具定义块末尾设置明确的前缀缓存断点。在Anthropic、OpenAI及Google Gemini等支持缓存的模型上,首轮之后缓存命中可将工具模式的输入Token计费成本削减75%至90%。
- 动态两阶段工具按需注册:避免将所有MCP工具无差别全局暴露。使用轻量级路由模型或向量语义索引,依据用户Prompt意图动态识别所需的具体业务域,仅将相关的3至5个工具Schema注入执行智能体的活跃上下文。
- Schema压缩与描述精简:去除工具Schema中冗长的排版缩进,剔除字符串内的Markdown长篇描述,用紧凑的类型定义取代冗余的字段释义。激进的Schema精简通常可在不影响工具调用准确率的前提下,降低35%到50%的工具定义体积。
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →