Quick answer: Le coût des embeddings est approuvé comme une ligne de projet : quelques millions de documents, un run unique, un chiffre modeste à côté de la génération. Puis cela ne s’arrête jamais, car trois...

Le coût récurrent des embeddings et du vector store

Updated September 1, 2026 · first published September 1, 2026

Le coût des embeddings est approuvé comme une ligne de projet : quelques millions de documents, un run unique, un chiffre modeste à côté de la génération. Puis cela ne s’arrête jamais, car trois forces distinctes ré-embeddent ce que vous avez déjà payé.

Les trois moteurs de rafraîchissement

Le churn de contenu : le plus honnête et le plus petit, il suit l’activité et se prévoit bien.

Les changements de chunking ou de pipeline : le sournois. Tout ajustement de taille de chunk, de recouvrement ou de prétraitement invalide tous les vecteurs. Une expérience de qualité de recherche qui ressemble à un réglage de config est un ré-embedding complet.

Les changements de modèle : le gros. Les espaces d’embedding ne sont pas compatibles entre modèles : pas de migration partielle, deux stores en parallèle ou une coupure.

Budgétez-le comme une annuité

Prévoyez au moins un ré-embedding complet par an. Évaluez un modèle sur le coût de ré-embedding plus un an de stockage et de requêtes, pas sur le prix par token. Et passez ces jobs en batch : c’est votre charge la plus tolérante à la latence.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research