Quick answer: Toute revue FinOps commence par le trafic de production, parce que c’est ce qui a un tableau de bord. Puis quelqu’un ventile par environnement et découvre qu’une part notable de la facture —...

Dépense LLM hors production

Updated September 1, 2026 · first published September 1, 2026

Toute revue FinOps commence par le trafic de production, parce que c’est ce qui a un tableau de bord. Puis quelqu’un ventile par environnement et découvre qu’une part notable de la facture — souvent à deux chiffres en pourcentage — n’a jamais touché un client.

D’où elle vient

La CI : chaque pull request qui lance une suite d’évaluation appelle le modèle, des milliers de fois par jour, sur le modèle le plus capable. Le développement local : itérer sur un prompt, c’est des dizaines d’appels par heure, sur une clé partagée, sans étiquette. Staging et démos : configurés comme la production, donc modèle cher et pas de cache. Reprises et boucles emballées en test, que personne ne surveille.

L’attribution d’abord

Le changement qui se rembourse seul : une clé d’API par environnement. Une après-midi de travail, et une ligne inexpliquée devient quatre lignes étiquetées. Étiquetez l’environnement sur chaque requête et, pour la CI, le dépôt et le workflow.

Trois conséquences suivent : hors production un modèle plus petit suffit presque toujours ; le cache y rapporte le plus, la CI rejouant des prompts quasi identiques ; et un plafond de dépense y est réellement sûr — un test plafonné casse un build, une production plafonnée casse un client.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research