Contrôler le coût en tokens des schémas MCP pour les agents
Updated September 19, 2026 · first published September 19, 2026
Connecter un agent IA à plusieurs serveurs Model Context Protocol (MCP) injecte des milliers de tokens d'entrée à chaque tour avant même le traitement de la requête utilisateur. Chaque outil enregistré ajoute un schéma JSON décrivant paramètres, types et fonctions. Avec plusieurs serveurs connectés (GitHub, Postgres, Slack), ce préambule absorbe 4 500 à 12 000 tokens par appel API. Sur une session de 30 tours, cela génère un coût fixe considérable.
Pourquoi les définitions d'outils MCP consomment-elles autant de tokens ?
Chaque outil MCP exige une description JSON Schema complète pour permettre au modèle de structurer ses appels. Une seule fonction de base de données peut consommer 300 à 600 tokens. Multiplié par des dizaines d'outils, le préambule statique encombre inutilement la fenêtre de contexte.
Trois leviers d'optimisation
Les équipes d'ingénierie appliquent la mise en cache de prompts (prefix caching) positionnée après la déclaration des outils, un routage sémantique dynamique pour ne charger que les outils utiles, et la minification des schémas JSON.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →