Pagar duas vezes a janela de contexto
Updated September 1, 2026 · first published September 1, 2026
Uma janela de contexto é anunciada como capacidade: 200.000 tokens, um milhão, espaço para o que precisar. A capacidade não é a unidade de faturação. Cobram-lhe o que envia, e numa conversa de vários turnos volta a enviar quase tudo em cada turno.
É esse o segundo pagamento. Um documento de 30.000 tokens carregado no início de uma conversa de vinte turnos não são 30.000 tokens de entrada: são perto de 600.000.
A conta que ninguém faz
O custo cresce com o quadrado do comprimento da conversa, não linearmente. Duplicar os turnos quase quadruplica os tokens de entrada. Quem modela "custo por mensagem" e multiplica subestima muito as sessões longas.
Costuma haver uma terceira cobrança: muitos fornecedores aplicam um preço superior acima de um limiar de contexto longo. Um anexo a mais pode atravessar essa linha e reencarecer a chamada inteira.
O que medir
Acompanhe a utilização do contexto: tokens enviados versus tokens realmente necessários. Meça tokens de entrada por conversa, não por pedido, e vigie o p99.
Três correções
Coloque o prefixo estável em cache — o maior retorno em qualquer produto de vários turnos.
Corte o histórico deliberadamente: resuma a parte antiga e descarte os turnos em bruto.
Envie o excerto, não o corpus.
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →