98% dos tokens de entrada do Codex estavam em cache. Sem cache, a conta seria 12 vezes maior
Atualizado October 9, 2026 · publicado originalmente October 9, 2026
Em 12 dias de uso intenso do Codex no ChatGPT Pro $100, enviamos 13.0 bilhões de tokens de entrada e recebemos de volta 47 milhões de tokens de saída. 97.6% dessa entrada foi um acerto de cache. Aos preços da API da OpenAI, o trabalho custou $1,211. Com os mesmos tokens e nenhum acerto de cache, sairia por $14,198, 12 vezes mais.
- Proporção entre entrada e saída: cerca de 279 tokens de entrada para cada token de saída.
- Participação da entrada em cache na conta: 60%, mesmo com desconto de 95%.
- Participação da saída na conta: 16%.
Por que quase toda a entrada dos agentes de código é cache
Um loop de agente reenvia a conversa inteira a cada passo: o prompt de sistema, as definições de ferramentas, os arquivos que ele leu e cada resultado anterior de ferramenta. Cada passo acrescenta um pouco e relê tudo. Por isso a entrada cresce com o quadrado da duração da sessão, enquanto a saída continua pequena. Em 12 dias, isso nos deu uma proporção de 279:1 entre entrada e saída.
O cache de prompts é o que mantém isso acessível. A entrada em cache na API da OpenAI custa um décimo ou menos da entrada normal. O GPT-6 Sol, que fez a maior parte do nosso trabalho, cobra $2 por milhão de tokens de entrada e $0.10 por milhão de tokens em cache.
Para onde foi o dinheiro
| Modelo | Tokens de entrada | Em cache | Tokens de saída | Valor de API | Sem cache |
|---|---|---|---|---|---|
| Sol | 6.56B | 98.1% | 17.5M | $1,073 | $13,299 |
| Luna | 6.41B | 97.2% | 29.0M | $95 | $655 |
| GPT-5.5 | 0.03B | 93.5% | 0.2M | $27 | $144 |
| Astra | 0.01B | 94.5% | 0.0M | $16 | $99 |
| Total | 13.01B | 97.6% | 47M | $1,211 | $14,198 |
| Componente do custo | Valor de API | Participação |
|---|---|---|
| Entrada em cache | $728 | 60% |
| Entrada sem cache | $288 | 24% |
| Saída | $196 | 16% |
Mesmo com desconto de 95%, a entrada em cache é a maior linha isolada. Essa é a assinatura de uma carga de trabalho de agente: o tipo de token mais barato, em volume enorme. Os totais por modelo estão em codex-pro-100-model-mix.csv.
O que quebra o cache
Um acerto de cache exige um prefixo idêntico. Qualquer mudança no início do contexto força a releitura, a preço cheio, de tudo o que vem depois.
- Trocar de modelo no meio da sessão. O modelo novo não tem cache do seu contexto.
- Editar instruções ou listas de ferramentas no meio da sessão. Elas ficam no topo do prompt, então tudo abaixo é relido.
- Pausas longas. Os caches expiram. Voltar depois de uma pausa relê a sessão a preço cheio.
- Compactação. Resumir o histórico reescreve o prefixo. Economiza tokens depois, mas custa uma passagem sem cache agora.
Por que isso importa para os seus limites do Codex
Se o medidor do Codex pondera a entrada em cache perto do preço da API, uma queda de 1 ponto na taxa de acerto de cache sai cara. No nosso volume, o Sol passar de 98.1% para 90% em cache acrescentaria cerca de $1,004 só de entrada do Sol, algo como 6 janelas extras do Pro $100. Disciplina de cache é disciplina de cota. Para saber o que cabe em uma janela, veja nossa medição do multiplicador do Pro $100; para entender como chegamos a oito janelas em 12 dias, veja o registro de resets.
Como medimos
O Codex grava um log JSONL de cada sessão em ~/.codex/sessions/. Cada requisição registra a entrada acumulada, a entrada em cache e a saída, além do medidor semanal (used_percent) e o horário de resets_at. Valoramos a variação de tokens de cada requisição pelo preço de tabela da API do modelo em que ela rodou e agrupamos as requisições por janela semanal. Os valores em dólar são valor equivalente de API, não dinheiro que de fato pagamos.
Fontes
Artigos relacionados
- ChatGPT Pro $100 é na prática 2.6x o Plus
- 8 janelas semanais do Codex em 12 dias
- Os resets do Codex transformaram $40 em $1,211
- Quanto de Codex o ChatGPT Pro inclui
- Claude Max 20x vs. ChatGPT Pro
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →