Quick answer: Une fonctionnalité LLM en production fait rarement un seul appel. Elle fait celui que vous avez conçu, puis ceux ajoutés ensuite pour la sûreté : classifieur d’entrée, vérification de sortie, juge de...

Ce que coûtent les garde-fous et la modération

Updated September 1, 2026 · first published September 1, 2026

Une fonctionnalité LLM en production fait rarement un seul appel. Elle fait celui que vous avez conçu, puis ceux ajoutés ensuite pour la sûreté : classifieur d’entrée, vérification de sortie, juge de politique, parfois un second modèle qui note le premier. Tout cela est de l’inférence, et l’inférence est facturée.

Le multiplicateur est plus grand qu’il n’y paraît

La modération d’entrée lit toute l’entrée, celle de sortie toute la réponse. Un juge lit les deux, plus le contexte récupéré et une grille — son appel est donc plus gros que celui qu’il juge.

Où la dépense s’accumule

Trois schémas : juger avec un modèle de pointe par facilité (la classification est justement la tâche où un petit modèle suffit, et c’est souvent la plus grosse économie disponible) ; vérifier à chaque tour en rescannant un historique déjà validé ; et des garde-fous sur le trafic interne, qui hérite d’une pile de sûreté grand public dont il n’a pas besoin.

Budgétez-le comme une ligne

Il ne s’agit pas de supprimer les contrôles, mais de voir qu’ils peuvent représenter 30 à 50% du coût d’inférence sans figurer dans le plan. Marquez les appels de garde-fou séparément en télémétrie.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research