Quick answer: O custo de embeddings é aprovado como rubrica de projeto: uns milhões de documentos, uma execução única, um número pequeno ao lado da geração. Depois nunca mais para, porque três forças distintas...

O custo recorrente de embeddings e vector stores

Updated September 1, 2026 · first published September 1, 2026

O custo de embeddings é aprovado como rubrica de projeto: uns milhões de documentos, uma execução única, um número pequeno ao lado da geração. Depois nunca mais para, porque três forças distintas voltam a embeber o que já pagou.

Os três motores de refrescamento

Rotação de conteúdo: o mais honesto e o mais pequeno, acompanha o negócio e prevê-se bem.

Mudanças de chunking ou pipeline: o traiçoeiro. Qualquer ajuste de tamanho de chunk, sobreposição ou pré-processamento invalida todos os vetores. Uma experiência de qualidade de recuperação que parece um ajuste de config é um re-embed completo.

Mudanças de modelo: o grande. Os espaços de embedding não são compatíveis entre modelos — não há migração parcial: ou mantém dois stores em paralelo ou aceita indisponibilidade.

Orçamente como anuidade

Preveja pelo menos um re-embed completo por ano. Avalie um modelo pelo custo de re-embed mais um ano de armazenamento e consultas, não pelo preço por token. E corra esses jobs em batch: é a carga mais tolerante a latência que tem.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research