Quick answer: Connecter un agent IA à plusieurs serveurs Model Context Protocol (MCP) injecte des milliers de tokens d'entrée à chaque tour avant même le traitement de la requête utilisateur. Chaque outil...

Contrôler le coût en tokens des schémas MCP pour les agents

Updated September 19, 2026 · first published September 19, 2026

Connecter un agent IA à plusieurs serveurs Model Context Protocol (MCP) injecte des milliers de tokens d'entrée à chaque tour avant même le traitement de la requête utilisateur. Chaque outil enregistré ajoute un schéma JSON décrivant paramètres, types et fonctions. Avec plusieurs serveurs connectés (GitHub, Postgres, Slack), ce préambule absorbe 4 500 à 12 000 tokens par appel API. Sur une session de 30 tours, cela génère un coût fixe considérable.

Pourquoi les définitions d'outils MCP consomment-elles autant de tokens ?

Chaque outil MCP exige une description JSON Schema complète pour permettre au modèle de structurer ses appels. Une seule fonction de base de données peut consommer 300 à 600 tokens. Multiplié par des dizaines d'outils, le préambule statique encombre inutilement la fenêtre de contexte.

Trois leviers d'optimisation

Les équipes d'ingénierie appliquent la mise en cache de prompts (prefix caching) positionnée après la déclaration des outils, un routage sémantique dynamique pour ne charger que les outils utiles, et la minification des schémas JSON.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research