Saltar para o conteúdo

O cache miss por trás da sua fatura da OpenAI

Atualizado September 26, 2026 · publicado originalmente September 26, 2026

Resposta rápida: Um painel de cache de prompts pode dizer que a reutilização caiu. Sozinho, ele não consegue dizer qual mudança na requisição causou a queda nem quanto ela custou. O lançamento de 8 de setembro de 2026...

Um painel de cache de prompts pode dizer que a reutilização caiu. Sozinho, ele não consegue dizer qual mudança na requisição causou a queda nem quanto ela custou. O lançamento de 8 de setembro de 2026 da OpenAI tornou o Prompt Cache Diagnostics disponível de forma geral na Responses API para o GPT-5.6 e modelos compatíveis posteriores. A jogada útil de FinOps é transformar uma queda nos tokens em cache em uma investigação curta e repetível.

Compare a requisição que falhou

Salve o ID de uma resposta recente e concluída cujo prefixo você esperava que fosse reutilizado. Na próxima requisição comparável à Responses API, feita pela mesma organização, defina prompt_cache_options.comparison_response_id com esse ID. Depois leia prompt_cache_diagnostics na nova resposta, junto com usage.input_tokens_details.cached_tokens. A opção de comparação solicita um diagnóstico; ela não carrega a conversa anterior nem altera o comportamento do cache. O guia de diagnósticos da OpenAI inclui exemplos de requisição que funcionam.

const next = await client.responses.create({
  model: model,
  instructions: stableInstructions,
  input: nextInput,
  tools: stableTools,
  prompt_cache_options: { comparison_response_id: baseline.id }
});
console.log(next.prompt_cache_diagnostics);
console.log(next.usage.input_tokens_details.cached_tokens);

O trecho pressupõe que baseline seja uma resposta recente e concluída, e que as demais variáveis sejam os dados da sua própria requisição. Mantenha um prefixo estável e longo o bastante para ser armazenado em cache: a OpenAI documenta um mínimo de 1.024 tokens para o GPT-5.6 e posteriores. Um prompt pequeno ou radicalmente diferente não é um teste significativo de cache miss.

Corrija a causa, não a métrica

Um resultado cache_miss pode apontar para mudança de modelo, nível de serviço, definições ou ordem das ferramentas, chave de cache, formato de resposta, esforço de raciocínio, verbosidade ou contexto compactado. Por exemplo, renomear o esquema de uma ferramenta, algo aparentemente inofensivo, pode invalidar o prefixo reutilizável. Compare a configuração da requisição e os primeiros bytes do prompt, restabeleça a estabilidade onde a mudança foi acidental e execute a comparação de novo contra a mesma linha de base. A OpenAI informa a primeira causa que encontra, então outra pode aparecer depois da primeira correção.

Não force um acerto se a mudança foi deliberada. Um modelo diferente pode reduzir o custo total da tarefa mesmo perdendo a reutilização de cache; a compactação pode reduzir o contexto futuro. Avalie a requisição e a tarefa inteiras, não o percentual de acertos de cache isoladamente. Uma linha de base expirada ou um resultado unavailable é inconclusivo, não prova de que o cache falhou.

Traduza o achado em dinheiro

cache_missed_tokens estima os tokens reutilizáveis perdidos em relação à resposta de comparação. Isso não é uma contagem de tokens faturados. Um resultado cache_hit também não estabelece economia em dólares. Para o custo de entrada realizado, colete o total de input_tokens, cached_tokens e cache_write_tokens de cada resposta e aplique a tarifa atual desse modelo e nível de processamento. Para o GPT-5.6 e posteriores, o guia de prompt caching da OpenAI informa que leituras de cache custam 0,1 vez a tarifa de entrada sem cache e escritas de cache custam 1,25 vez essa tarifa.

ordinary = input_tokens - cached_tokens - cache_write_tokens
weighted_input = ordinary + 0.1 * cached_tokens + 1.25 * cache_write_tokens
input_cost = weighted_input * input_price_per_million / 1_000_000

Essas categorias de tokens são mutuamente exclusivas: não some um acréscimo de escrita em cache a tokens que já foram contados na tarifa de escrita. Esta fórmula cobre apenas a entrada; inclua saída, ferramentas, novas tentativas e outras cobranças ao calcular o custo por tarefa bem-sucedida. Use a tabela de preços atual do provedor em vez de um preço fixo copiado deste artigo.

Uma verificação semanal útil

  1. Agrupe o tráfego comparável por carga de trabalho, modelo e nível de serviço; represente em gráfico a proporção de tokens em cache e o custo de entrada por tarefa concluída.
  2. Amostre uma regressão repentina, compare-a com uma linha de base recente e registre o motivo do diagnóstico e a mudança de código responsável.
  3. Corrija o desvio acidental de prefixo ou configuração; mantenha as mudanças intencionais de qualidade ou roteamento se a economia total da tarefa melhorar.
  4. Valide o resultado com tráfego de produção representativo e concilie a economia observada com o faturamento.

Os diagnósticos em si não têm taxa extra pelo recurso, mas as requisições de teste adicionais são faturadas normalmente. O ganho não é um gráfico de taxa de acerto mais bonito. É uma explicação defensável de por que o custo de entrada de uma carga de trabalho específica mudou, e se a correção proposta realmente reduziu a fatura dela.

Perguntas que as equipes fazem

Um diagnóstico de cache hit prova que uma requisição foi mais barata?

Não. Ele indica que nenhum miss foi detectado em relação à linha de base selecionada. Confira os cached_tokens reais e as categorias de tokens precificadas da requisição antes de afirmar que houve economia.

Os diagnósticos podem comparar duas requisições quaisquer da OpenAI?

Não. Use uma linha de base recente e concluída da mesma organização e espere esse fluxo apenas em modelos compatíveis da Responses API a partir do GPT-5.6. Um registro de comparação pode expirar.

Todo cache miss deve ser eliminado?

Não. Uma troca de modelo, um nível de serviço diferente ou um contexto compactado podem ser intencionais. Compare qualidade, latência e custo por tarefa bem-sucedida antes de reverter a mudança.

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com