Controlar el coste de tokens de esquemas MCP en agentes
Updated September 19, 2026 · first published September 19, 2026
Conectar un agente de IA a múltiples servidores Model Context Protocol (MCP) introduce miles de tokens de entrada en cada turno antes de procesar la petición del usuario. Cada herramienta registrada añade un esquema JSON con nombres de funciones, descripciones de parámetros y tipos. En entornos con varios servidores MCP (GitHub, Postgres, Slack, Jira), esta cabecera estática consume entre 4.500 y 12.000 tokens por llamada. En flujos de 30 turnos, esto representa un gasto continuo innecesario.
Por qué las definiciones de herramientas MCP consumen tantos tokens
Cada herramienta MCP necesita metadatos detallados en formato JSON Schema para que el modelo identifique cómo invocarla. Un esquema complejo de base de datos puede costar 500 tokens por sí solo. Al sumar decenas de herramientas, gran parte de la ventana de contexto se llena con contratos estáticos.
Estrategias de optimización
Para mitigar este impacto, los equipos de plataforma implementan puntos de corte de caché de prompts (prefix caching) justo tras el bloque de herramientas, enrutamiento dinámico en dos fases para inyectar únicamente las 3 o 4 herramientas relevantes para la tarea, y minificación estricta de esquemas.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →