Le style de prompt sur la facture
Updated September 1, 2026 · first published September 1, 2026
Les prompts grossissent comme les fichiers de configuration : quelqu’un ajoute une consigne après un bug, un autre un exemple, un troisième un paragraphe d’explication. On ne retire jamais rien. Six mois plus tard, le system prompt fait trois mille tokens et personne ne sait lesquels portent la structure.
Pourquoi cela s’accumule
Contrairement à la sortie, le surcoût du prompt se paie à chaque requête, à l’identique, indéfiniment. Mille tokens gaspillés sur dix millions d’appels mensuels, ce sont dix milliards de tokens de pure mise en forme par mois.
En conversation multi-tours c’est pire : le system prompt est renvoyé à chaque tour. Dans une boucle d’agent, une seule action utilisateur facture le même préambule une dizaine de fois.
Ce qui gaspille vraiment
Pas la politesse. Le poids est dans les consignes redondantes, le boilerplate défensif écrit pour une génération de modèles révolue, les exemples qui se dupliquent, et les explications destinées aux humains qui lisent le fichier.
Traitez-le comme du code avec un budget
Mesurez le prompt fixe en part de la requête moyenne. Placez la partie stable en tête pour le cache. Puis élaguez par ablation contre vos évaluations : retirez un bloc, mesurez, gardez le retrait si la qualité tient.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →