Estratégias de cache comparadas
A cache é uma das táticas de redução de custos com maior alavancagem para cargas de trabalho de LLM. A ideia é direta: não pague por inferência se você conseguir devolver um resultado em cache. Mas "cache" não é uma única técnica — são quatro estratégias distintas com diferentes compensações em economia de custos, latência, precisão e complexidade de implementação. Escolher a errada desperdiça esforço de engenharia; escolher a correta pode reduzir entre 30% e 70% sua fatura.
Comparação de estratégias
| Estratégia | Como funciona | Economia de custos | Impacto na latência | Esforço de implementação | Ideal para | Provedores |
|---|---|---|---|---|---|---|
| Cache de prompts (lado do provedor) | O provedor armazena em cache o cálculo KV para prefixos de prompts repetidos. Requisições subsequentes com o mesmo prefixo pulam o reprocessamento. | 50% em tokens de entrada em cache | 60–80% mais rápido na latência do primeiro token | Nulo a baixo — automático na maioria dos provedores | Prompts de sistema longos, RAG com contexto compartilhado, loops de agentes | OpenAI, Anthropic, Google |
| Cache semântico (baseado em embeddings) | Incorpora (embed) a consulta do usuário, busca em um armazenamento vetorial por consultas passadas semelhantes. Se a similaridade exceder um limiar, devolve a resposta em cache sem chamar o LLM. | 20–50% dependendo da repetição de consultas | 50–90% mais rápido (sem chamada ao LLM) | Médio — precisa de modelo de embeddings, armazenamento vetorial, ajuste de limiar de similaridade | Bots de FAQ, suporte ao cliente, consultas repetitivas | Qualquer um (auto-hospedado via GPTCache, Redis com busca vetorial) |
| Cache de contexto (estilo Google) | Armazena documentos de contexto grandes (PDFs, repositórios de código) no servidor. Pague uma vez pelo processamento de contexto, reutilize em muitas consultas com custo reduzido por consulta. | 70–90% em consultas com muito contexto | Melhoria moderada no processamento de contexto | Baixo a médio — envie contexto, gerencie TTL | Perguntas e respostas sobre documentos, revisão de código em repos grandes, múltiplas rodadas com contexto estático | Google (Gemini), Anthropic (contexto de pensamento estendido) |
| Cache no nível de aplicação (Redis/CDN) | Hash determinístico da requisição completa (prompt + parâmetros). Armazena a resposta no Redis ou CDN. Devolve a resposta em cache na correspondência exata. | Até 100% em acertos de cache | 90–99% mais rápido (sem chamada ao LLM) | Baixo — infraestrutura de cache padrão | Consultas determinísticas, classificação, extração com prompts fixos | Qualquer um (infraestrutura que você controla) |
Cache de prompts em detalhes
O cache de prompts é a vitória mais fácil. OpenAI armazena em cache automaticamente prompts mais longos que 1.024 tokens. Anthropic armazena em cache prefixos de 2.048+ tokens. O cache é indexado pelo prefixo exato — mesmo prompt de sistema, mesmos exemplos few-shot, mesmo contexto de documento. Quando há um acerto de cache, você paga 50% menos pela parte em cache dos tokens de entrada.
A desvantagem: a invalidação de cache é controlada pelo provedor. Se o prompt mudar mesmo ligeiramente — mensagem de sistema diferente, variável diferente no prefixo — o cache falha. Projete seus prompts para colocar conteúdo estável no início e conteúdo dinâmico no final do prompt.
Cache semântico em detalhes
O cache semântico pula o LLM completamente quando uma pergunta semelhante foi feita antes. O fluxo: incorpore a consulta, pesquise em um armazenamento vetorial (Pinecone, Qdrant, Redis com busca vetorial), verifique se o resultado principal excede um limiar de similaridade (tipicamente 0,92–0,97) e devolva a resposta em cache se for assim.
O risco é devolver respostas obsoletas ou ligeiramente incorretas. Um limiar muito baixo devolve resultados errados; um muito alto significa quase nenhum acerto de cache. Ajuste-o por caso de uso. Para recuperação factual de FAQ, 0,95+ é seguro. Para geração criativa, o cache semântico raramente é apropriado — o ponto todo é a novidade.
Cache de contexto em detalhes
O cache de contexto do Google permite que você envie um documento grande uma vez e pague uma taxa reduzida para consultas subsequentes contra ele. Isso é poderoso para perguntas e respostas sobre documentos onde você processa o mesmo PDF de 200 páginas centenas de vezes. O modelo de custos: pague a taxa completa de tokens de entrada uma vez para a escrita em cache, depois uma taxa reduzida (geralmente 25% do normal) para cada leitura de cache.
A compensação é o TTL. Contextos em cache expiram. Se sua carga de trabalho tem padrões de acesso em rajadas — 500 consultas em uma hora, depois nada por uma semana — o cache pode expirar entre rajadas. Dimensione seu TTL para corresponder ao seu padrão de acesso.
Cache no nível de aplicação em detalhes
O cache determinístico é a estratégia mais agressiva. Faça hash da carga completa da requisição (prompt, temperatura, tokens máximos, modelo, ferramentas) e armazene a resposta. Na correspondência exata, devolva a resposta em cache instantaneamente — sem chamada ao LLM, sem latência, sem custo.
Isso funciona apenas quando a mesma entrada deve sempre produzir a mesma saída. Classificação, extração de entidades, análise de dados estruturados e geração baseada em templates são bons candidatos. Tarefas conversacionais ou criativas não são — os usuários esperam respostas variadas.
Combinando estratégias
As melhores implementações sobrepõem múltiplas estratégias. Uma pilha típica: cache no nível de aplicação como primeira verificação (mais barata, mais rápida), cache semântico como segunda verificação (captura quase-duplicatas), depois a chamada ao LLM com cache de prompts habilitado no lado do provedor (reduz custo mesmo em falhas de cache). Essa abordagem em camadas pode reduzir o gasto total em LLM entre 40% e 70% em cargas de trabalho com qualquer grau de repetição.
Acompanhe as taxas de acerto de cache separadamente para cada camada. Se sua taxa de acerto de cache semântico cair abaixo de 10%, a sobrecarga do armazenamento vetorial pode não valer a pena. Se sua taxa de acerto de cache de aplicação estiver acima de 40%, você provavelmente tem tarefas determinísticas que deveriam ser otimizadas no nível de prompt.
Relacionado
- Cache de prompts explicado — análise mais profunda de cache no lado do provedor.
- Economia de cache semântico — análise de ROI de cache semântico.
- Otimização de custos de IA — estratégias de otimização mais amplas.
Deseja isso aplicado ao seu próprio gasto com LLM? FinOps LLM executa uma auditoria gratuita de seus custos de IA e mostra onde estão as economias. Agendar auditoria gratuita →