Saltar para o conteúdo

98% dos tokens de entrada do Codex estavam em cache. Sem cache, a conta seria 12 vezes maior

Atualizado October 9, 2026 · publicado originalmente October 9, 2026

Resposta rápida: Em 12 dias de uso intenso do Codex no ChatGPT Pro $100, enviamos 13.0 bilhões de tokens de entrada e recebemos de volta 47 milhões de tokens de saída. 97.6% dessa entrada foi um acerto de cache. Aos...

Em 12 dias de uso intenso do Codex no ChatGPT Pro $100, enviamos 13.0 bilhões de tokens de entrada e recebemos de volta 47 milhões de tokens de saída. 97.6% dessa entrada foi um acerto de cache. Aos preços da API da OpenAI, o trabalho custou $1,211. Com os mesmos tokens e nenhum acerto de cache, sairia por $14,198, 12 vezes mais.

Valor de API de 12 dias de Codex por modelo: com cache e sem cache$0$2k$4k$6k$8k$10k$12k$14k$1,073$13,299Sol$95$655Luna$27$144GPT-5.5$16$99AstraLaranja: o que pagamos em termos de API, com cacheAzul: os mesmos tokens sem acertos de cache
Valor de API de 12 dias de Codex por modelo: com cache e sem cache

Por que quase toda a entrada dos agentes de código é cache

Um loop de agente reenvia a conversa inteira a cada passo: o prompt de sistema, as definições de ferramentas, os arquivos que ele leu e cada resultado anterior de ferramenta. Cada passo acrescenta um pouco e relê tudo. Por isso a entrada cresce com o quadrado da duração da sessão, enquanto a saída continua pequena. Em 12 dias, isso nos deu uma proporção de 279:1 entre entrada e saída.

O cache de prompts é o que mantém isso acessível. A entrada em cache na API da OpenAI custa um décimo ou menos da entrada normal. O GPT-6 Sol, que fez a maior parte do nosso trabalho, cobra $2 por milhão de tokens de entrada e $0.10 por milhão de tokens em cache.

Para onde foi o dinheiro

ModeloTokens de entradaEm cacheTokens de saídaValor de APISem cache
Sol6.56B98.1%17.5M$1,073$13,299
Luna6.41B97.2%29.0M$95$655
GPT-5.50.03B93.5%0.2M$27$144
Astra0.01B94.5%0.0M$16$99
Total13.01B97.6%47M$1,211$14,198
Componente do custoValor de APIParticipação
Entrada em cache$72860%
Entrada sem cache$28824%
Saída$19616%

Mesmo com desconto de 95%, a entrada em cache é a maior linha isolada. Essa é a assinatura de uma carga de trabalho de agente: o tipo de token mais barato, em volume enorme. Os totais por modelo estão em codex-pro-100-model-mix.csv.

O que quebra o cache

Um acerto de cache exige um prefixo idêntico. Qualquer mudança no início do contexto força a releitura, a preço cheio, de tudo o que vem depois.

Por que isso importa para os seus limites do Codex

Se o medidor do Codex pondera a entrada em cache perto do preço da API, uma queda de 1 ponto na taxa de acerto de cache sai cara. No nosso volume, o Sol passar de 98.1% para 90% em cache acrescentaria cerca de $1,004 só de entrada do Sol, algo como 6 janelas extras do Pro $100. Disciplina de cache é disciplina de cota. Para saber o que cabe em uma janela, veja nossa medição do multiplicador do Pro $100; para entender como chegamos a oito janelas em 12 dias, veja o registro de resets.

Como medimos

O Codex grava um log JSONL de cada sessão em ~/.codex/sessions/. Cada requisição registra a entrada acumulada, a entrada em cache e a saída, além do medidor semanal (used_percent) e o horário de resets_at. Valoramos a variação de tokens de cada requisição pelo preço de tabela da API do modelo em que ela rodou e agrupamos as requisições por janela semanal. Os valores em dólar são valor equivalente de API, não dinheiro que de fato pagamos.

Fontes

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com