Quick answer: Uma janela de contexto é anunciada como capacidade: 200.000 tokens, um milhão, espaço para o que precisar. A capacidade não é a unidade de faturação. Cobram-lhe o que envia, e numa conversa de vários...

Pagar duas vezes a janela de contexto

Updated September 1, 2026 · first published September 1, 2026

Uma janela de contexto é anunciada como capacidade: 200.000 tokens, um milhão, espaço para o que precisar. A capacidade não é a unidade de faturação. Cobram-lhe o que envia, e numa conversa de vários turnos volta a enviar quase tudo em cada turno.

É esse o segundo pagamento. Um documento de 30.000 tokens carregado no início de uma conversa de vinte turnos não são 30.000 tokens de entrada: são perto de 600.000.

A conta que ninguém faz

O custo cresce com o quadrado do comprimento da conversa, não linearmente. Duplicar os turnos quase quadruplica os tokens de entrada. Quem modela "custo por mensagem" e multiplica subestima muito as sessões longas.

Costuma haver uma terceira cobrança: muitos fornecedores aplicam um preço superior acima de um limiar de contexto longo. Um anexo a mais pode atravessar essa linha e reencarecer a chamada inteira.

O que medir

Acompanhe a utilização do contexto: tokens enviados versus tokens realmente necessários. Meça tokens de entrada por conversa, não por pedido, e vigie o p99.

Três correções

Coloque o prefixo estável em cache — o maior retorno em qualquer produto de vários turnos.

Corte o histórico deliberadamente: resuma a parte antiga e descarte os turnos em bruto.

Envie o excerto, não o corpus.

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research