O custo recorrente de embeddings e vector stores
Updated September 1, 2026 · first published September 1, 2026
O custo de embeddings é aprovado como rubrica de projeto: uns milhões de documentos, uma execução única, um número pequeno ao lado da geração. Depois nunca mais para, porque três forças distintas voltam a embeber o que já pagou.
Os três motores de refrescamento
Rotação de conteúdo: o mais honesto e o mais pequeno, acompanha o negócio e prevê-se bem.
Mudanças de chunking ou pipeline: o traiçoeiro. Qualquer ajuste de tamanho de chunk, sobreposição ou pré-processamento invalida todos os vetores. Uma experiência de qualidade de recuperação que parece um ajuste de config é um re-embed completo.
Mudanças de modelo: o grande. Os espaços de embedding não são compatíveis entre modelos — não há migração parcial: ou mantém dois stores em paralelo ou aceita indisponibilidade.
Orçamente como anuidade
Preveja pelo menos um re-embed completo por ano. Avalie um modelo pelo custo de re-embed mais um ano de armazenamento e consultas, não pelo preço por token. E corra esses jobs em batch: é a carga mais tolerante a latência que tem.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →