Le coût récurrent des embeddings et du vector store
Updated September 1, 2026 · first published September 1, 2026
Le coût des embeddings est approuvé comme une ligne de projet : quelques millions de documents, un run unique, un chiffre modeste à côté de la génération. Puis cela ne s’arrête jamais, car trois forces distinctes ré-embeddent ce que vous avez déjà payé.
Les trois moteurs de rafraîchissement
Le churn de contenu : le plus honnête et le plus petit, il suit l’activité et se prévoit bien.
Les changements de chunking ou de pipeline : le sournois. Tout ajustement de taille de chunk, de recouvrement ou de prétraitement invalide tous les vecteurs. Une expérience de qualité de recherche qui ressemble à un réglage de config est un ré-embedding complet.
Les changements de modèle : le gros. Les espaces d’embedding ne sont pas compatibles entre modèles : pas de migration partielle, deux stores en parallèle ou une coupure.
Budgétez-le comme une annuité
Prévoyez au moins un ré-embedding complet par an. Évaluez un modèle sur le coût de ré-embedding plus un an de stockage et de requêtes, pas sur le prix par token. Et passez ces jobs en batch : c’est votre charge la plus tolérante à la latence.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →