Impacto en costes de servidores MCP
El Protocolo de Contexto de Modelo (MCP) permite a los LLM llamar a herramientas externas: bases de datos, APIs, sistemas de archivos, motores de búsqueda. Es potente. También es caro. Cada definición de herramienta MCP consume espacio en la ventana de contexto, cada llamada a herramienta es un viaje de ida y vuelta a la API por separado, y cada resultado de herramienta se devuelve al modelo como tokens de entrada adicionales. Para equipos que ejecutan flujos de trabajo de agentes intensivos en MCP, la sobrecarga relacionada con herramientas puede representar el 30–60% del gasto total en tokens.
Este artículo explica cómo MCP incrementa los costes, cómo medir la sobrecarga y qué hacer al respecto.
Cómo MCP consume tokens
Hay tres capas de coste en tokens en cada interacción MCP:
Capa 1: Definiciones de herramientas. Cada servidor MCP registra herramientas con el modelo. Una definición de herramienta incluye el nombre de la función, el esquema de parámetros y una descripción de lo que hace la herramienta. Una definición de herramienta típicamente consume 500–2.000 tokens. Un servidor con 15 herramientas añade 7,5K–30K tokens a cada solicitud, incluso si no se llama a ninguna de esas herramientas.
Capa 2: Solicitudes de llamada a herramientas. Cuando el modelo decide llamar a una herramienta, genera una salida de llamada a herramienta (nombre de función + argumentos). Esto se factura como tokens de salida. Luego el resultado de la herramienta vuelve como tokens de entrada. Un solo viaje de ida y vuelta de llamada a herramienta típicamente cuesta 1K–5K tokens dependiendo del tamaño del resultado.
Capa 3: Resultados de herramientas en contexto. Los resultados de herramientas permanecen en el contexto de la conversación para todos los turnos posteriores. Si llamas a 10 herramientas en una sesión, esos resultados se acumulan. Una consulta a base de datos que devuelve 50 filas de JSON puede añadir 8K–15K tokens que persisten durante el resto de la conversación.
El efecto compuesto
Los costes de MCP se componen porque las definiciones de herramientas se envían con cada solicitud. Si tienes 20 herramientas definidas (10K–40K tokens de definiciones) y haces 5 solicitudes en una conversación, solo las definiciones de herramientas cuestan 50K–200K tokens de entrada. Añade los resultados de las llamadas a herramientas y fácilmente puedes duplicar tu consumo base de tokens.
| Patrón MCP | Sobrecarga en tokens | Frecuencia | Impacto mensual en costes (estimación) |
|---|---|---|---|
| Definiciones de herramientas (10 herramientas) | 5K–20K tokens por solicitud | Cada solicitud | $15–$60 por usuario |
| Viaje de ida y vuelta de una llamada a herramienta | 1K–5K tokens | 3–10 por sesión | $5–$25 por usuario |
| Resultado grande de herramienta (consulta DB, búsqueda de código) | 5K–20K tokens | 1–5 por sesión | $10–$50 por usuario |
| Resultados acumulados en sesión larga | 20K–100K tokens | 1–3 sesiones/día | $30–$120 por usuario |
| Definiciones de herramientas no usadas cargadas | 5K–30K tokens por solicitud | Cada solicitud | $15–$90 por usuario |
Cómo medir la sobrecarga de MCP
La forma más simple de medir el coste de MCP es ejecutar el mismo prompt dos veces: una con herramientas MCP cargadas y otra sin ellas. La diferencia en tokens de entrada es tu sobrecarga de definiciones de herramientas. Luego cuenta los tokens de llamadas a herramientas por separado: la mayoría de proveedores los etiquetan distintamente en sus paneles de facturación.
Para una medición más precisa, instrumenta tu cliente MCP para registrar: número de herramientas registradas, tokens consumidos por definiciones de herramientas por solicitud, número de llamadas a herramientas por sesión, tokens por resultado de herramienta y tokens totales de sesión atribuidos a actividad de herramientas.
Estrategias para reducir los costes de MCP
1. Carga herramientas selectivamente. No registres todas las herramientas para cada solicitud. Si el usuario está haciendo una pregunta de código, no necesita herramientas de base de datos o despliegue cargadas. Muchos clientes MCP soportan carga dinámica de herramientas basada en contexto o activación explícita del usuario.
2. Minimiza las descripciones de herramientas. Las descripciones de herramientas son el mayor consumidor de tokens en las definiciones. Una descripción verbosa puede ser 500 tokens; una concisa puede ser 100 tokens. En 20 herramientas, eso es una diferencia de 8K tokens por solicitud.
3. Trunca los resultados de herramientas. Devuelve solo los campos que el modelo realmente necesita. Si una consulta a base de datos devuelve 20 columnas pero el modelo solo necesita 3, proyecta el resultado. Limita el tamaño del resultado a un límite razonable: 2K–4K tokens es generalmente suficiente para que el modelo tome una decision.
4. Cachea llamadas repetidas. Si la misma herramienta se llama con los mismos argumentos en una sesión, devuelve el resultado cacheado en lugar de ejecutar de nuevo. Esto es especialmente valioso para búsquedas de referencia, consultas de esquema y obtención de documentación.
5. Resume antes de inyectar. Para resultados grandes de herramientas (contenido completo de archivos, respuestas largas de API), resume antes de añadir al contexto. Devuelve un resumen más la opción de obtener el resultado completo si el modelo lo necesita.
6. Usa límites de presupuesto para resultados de herramientas. Establece un presupuesto por sesión para tokens de resultados de herramientas. Cuando se alcanza el presupuesto, rechaza más llamadas a herramientas o cambia a un modelo más barato para el resto de la sesión.
El coste oculto de los servidores MCP
Más allá de los costes en tokens, los servidores MCP introducen sobrecarga de latencia y fiabilidad. Una llamada a herramienta que tarda 3 segundos en responder añade latencia a cada turno. Una herramienta que falla intermitentemente causa reintentos. Ambos aumentan el coste efectivo por tarea.
Para equipos que escalan el uso de MCP en una organización, rastrear estos costes a nivel de servidor es esencial. Enruta las cargas de trabajo intensivas en MCP a modelos con costes por token más bajos, y mantén los flujos de trabajo ligeros en MCP en modelos premium donde la latencia importa.
Relacionado
- Economía de agentes - cómo se calculan los precios de los agentes de codificación en la práctica.
- Atribución del gasto de agentes - rastreo de costes de agentes por proyecto.
- Seguimiento de tokens de LLM - medición de lo que gastas.
- FinOps para LLM - el marco más amplio.
¿Quieres que esto se aplique a tu propio gasto en LLM? FinOps LLM ejecuta una auditoría gratuita de tus costes en IA y muestra dónde están los ahorros. Solicita tu auditoría gratuita →