Impact des serveurs MCP sur les coûts
Le Protocole de contexte du modèle (MCP) permet aux LLM d'appeler des outils externes : bases de données, API, systèmes de fichiers, moteurs de recherche. C'est puissant. C'est aussi coûteux. Chaque définition d'outil MCP consomme l'espace de la fenêtre de contexte, chaque appel d'outil est un aller-retour API séparé, et chaque résultat d'outil est réinjecté dans le modèle sous forme de tokens d'entrée supplémentaires. Pour les équipes qui exécutent des flux de travail d'agents intensifs en MCP, la surcharge liée aux outils peut représenter 30–60 % des dépenses totales de tokens.
Cet article explique comment MCP augmente les coûts, comment mesurer la surcharge et que faire à ce sujet.
Comment MCP consomme les tokens
Il y a trois niveaux de coûts en tokens dans chaque interaction MCP :
Niveau 1 : Définitions des outils. Chaque serveur MCP enregistre les outils auprès du modèle. Une définition d'outil comprend le nom de la fonction, le schéma des paramètres et une description de ce que fait l'outil. Une seule définition d'outil consomme généralement 500–2 000 tokens. Un serveur avec 15 outils ajoute 7,5K–30K tokens à chaque demande, même si aucun de ces outils n'est appelé.
Niveau 2 : Demandes d'appel d'outil. Quand le modèle décide d'appeler un outil, il génère une sortie d'appel d'outil (nom de fonction + arguments). Ceci est facturé comme tokens de sortie. Puis le résultat de l'outil revient sous forme de tokens d'entrée. Un seul aller-retour d'appel d'outil coûte généralement 1K–5K tokens selon la taille du résultat.
Niveau 3 : Résultats d'outils en contexte. Les résultats d'outils restent dans le contexte de la conversation pour tous les tours ultérieurs. Si vous appelez 10 outils dans une session, ces résultats s'accumulent. Une requête de base de données retournant 50 lignes de JSON peut ajouter 8K–15K tokens qui persistent pour le reste de la conversation.
L'effet composé
Les coûts MCP se composent parce que les définitions d'outils sont envoyées avec chaque demande. Si vous avez 20 outils définis (10K–40K tokens de définitions) et que vous faites 5 demandes dans une conversation, les définitions d'outils seules coûtent 50K–200K tokens d'entrée. Ajoutez les résultats des appels d'outils et vous pouvez facilement doubler votre consommation de base de tokens.
| Motif MCP | Surcharge en tokens | Fréquence | Impact sur les coûts mensuels (estimation) |
|---|---|---|---|
| Définitions d'outils (10 outils) | 5K–20K tokens par demande | Chaque demande | 15–60 $ par utilisateur |
| Aller-retour d'appel d'outil unique | 1K–5K tokens | 3–10 par session | 5–25 $ par utilisateur |
| Résultat d'outil volumineux (requête DB, recherche de code) | 5K–20K tokens | 1–5 par session | 10–50 $ par utilisateur |
| Résultats accumulés dans une session longue | 20K–100K tokens | 1–3 sessions/jour | 30–120 $ par utilisateur |
| Définitions d'outils inutilisés chargées | 5K–30K tokens par demande | Chaque demande | 15–90 $ par utilisateur |
Comment mesurer la surcharge MCP
La façon la plus simple de mesurer le coût de MCP est d'exécuter la même requête deux fois : une fois avec les outils MCP chargés et une fois sans. La différence en tokens d'entrée est votre surcharge de définitions d'outils. Ensuite, comptez les tokens des appels d'outils séparément : la plupart des fournisseurs les étiquettent clairement dans leurs tableaux de bord de facturation.
Pour une mesure plus précise, instrumentez votre client MCP pour enregistrer : nombre d'outils enregistrés, tokens consommés par les définitions d'outils par demande, nombre d'appels d'outils par session, tokens par résultat d'outil et tokens totaux de session attribués à l'activité des outils.
Stratégies pour réduire les coûts MCP
1. Chargez les outils de manière sélective. N'enregistrez pas tous les outils pour chaque demande. Si l'utilisateur pose une question sur le code, il n'a pas besoin de charger les outils de base de données ou de déploiement. De nombreux clients MCP prennent en charge le chargement dynamique des outils en fonction du contexte ou de l'activation explicite par l'utilisateur.
2. Minimisez les descriptions d'outils. Les descriptions d'outils sont le plus grand consommateur de tokens dans les définitions. Une description verbale peut être 500 tokens ; une concise peut être 100 tokens. Sur 20 outils, c'est une différence de 8K tokens par demande.
3. Tronquez les résultats d'outils. Retournez uniquement les champs dont le modèle a réellement besoin. Si une requête de base de données retourne 20 colonnes mais que le modèle n'en a besoin que de 3, projetez le résultat. Limitez la taille du résultat à une limite raisonnable : 2K–4K tokens suffisent généralement pour que le modèle prenne une décision.
4. Mettez en cache les appels répétés. Si le même outil est appelé avec les mêmes arguments dans une session, retournez le résultat mis en cache au lieu d'exécuter à nouveau. Ceci est particulièrement précieux pour les recherches de référence, les requêtes de schéma et les récupérations de documentation.
5. Résumez avant d'injecter. Pour les résultats d'outils volumineux (contenu complet de fichiers, réponses API longues), résumez avant d'ajouter au contexte. Retournez un résumé plus l'option d'obtenir le résultat complet si le modèle en a besoin.
6. Utilisez des limites budgétaires pour les résultats d'outils. Définissez un budget par session pour les tokens de résultats d'outils. Quand le budget est atteint, refusez d'autres appels d'outils ou basculez vers un modèle moins cher pour le reste de la session.
Le coût caché des serveurs MCP
Au-delà des coûts en tokens, les serveurs MCP introduisent une surcharge de latence et de fiabilité. Un appel d'outil qui prend 3 secondes à répondre ajoute de la latence à chaque tour. Un outil qui échoue de manière intermittente provoque des tentatives. Les deux augmentent le coût effectif par tâche.
Pour les équipes qui étendent l'utilisation de MCP dans une organisation, suivre ces coûts au niveau du serveur est essentiel. Routez les charges de travail intensives en MCP vers les modèles avec des coûts par token plus bas, et gardez les flux de travail légers en MCP sur les modèles premium où la latence est importante.
Relatif
- Économie des agents - comment les agents de codification se tarient dans la pratique.
- Attribution des dépenses d'agents - suivi des coûts des agents par projet.
- Suivi des tokens LLM - mesurer ce que vous dépensez.
- FinOps pour LLM - le cadre plus large.
Voulez-vous que cela s'applique à vos propres dépenses LLM ? FinOps LLM effectue un audit gratuit de vos coûts en IA et vous montre où se trouvent les économies. Demandez votre audit gratuit →