El coste recurrente de embeddings y vectores
Updated September 1, 2026 · first published September 1, 2026
El coste de embeddings se aprueba como partida de proyecto: unos millones de documentos, una ejecución única, una cifra pequeña al lado de la generación. Luego no para nunca, porque tres fuerzas distintas vuelven a embeber lo que ya pagaste.
Los tres motores de refresco
Rotación de contenido: la honesta y la más pequeña, escala con el negocio y se predice bien.
Cambios de chunking o pipeline: la traicionera. Cualquier ajuste de tamaño de chunk, solape o preprocesado invalida todos los vectores. Un experimento de calidad de recuperación que suena a cambio de config es un re-embed completo.
Cambios de modelo: la grande. Los espacios de embedding no son compatibles entre modelos, así que no hay migración parcial: o mantienes dos almacenes en paralelo o asumes corte.
Presupuéstalo como una anualidad
Prevé al menos un re-embed completo al año. Valora un modelo por coste de re-embed más un año de almacenamiento y consultas, no por precio por token. Y lanza esos trabajos por batch: es tu carga más tolerante a latencia.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →