Ce que coûtent les garde-fous et la modération
Updated September 1, 2026 · first published September 1, 2026
Une fonctionnalité LLM en production fait rarement un seul appel. Elle fait celui que vous avez conçu, puis ceux ajoutés ensuite pour la sûreté : classifieur d’entrée, vérification de sortie, juge de politique, parfois un second modèle qui note le premier. Tout cela est de l’inférence, et l’inférence est facturée.
Le multiplicateur est plus grand qu’il n’y paraît
La modération d’entrée lit toute l’entrée, celle de sortie toute la réponse. Un juge lit les deux, plus le contexte récupéré et une grille — son appel est donc plus gros que celui qu’il juge.
Où la dépense s’accumule
Trois schémas : juger avec un modèle de pointe par facilité (la classification est justement la tâche où un petit modèle suffit, et c’est souvent la plus grosse économie disponible) ; vérifier à chaque tour en rescannant un historique déjà validé ; et des garde-fous sur le trafic interne, qui hérite d’une pile de sûreté grand public dont il n’a pas besoin.
Budgétez-le comme une ligne
Il ne s’agit pas de supprimer les contrôles, mais de voir qu’ils peuvent représenter 30 à 50% du coût d’inférence sans figurer dans le plan. Marquez les appels de garde-fou séparément en télémétrie.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →