Como verificar e reduzir o uso de tokens do Claude Code
Atualizado September 27, 2026 · publicado originalmente September 27, 2026
Execute /usage para ver quanto o Claude Code está gastando e /context para ver o que está preenchendo a janela. Para gastar menos, mantenha o contexto pequeno: limpe entre as tarefas, reduza o nível de esforço e mantenha saídas extensas fora da conversa principal. O contexto importa mais do que qualquer outra coisa porque o Claude Code reenvia a conversa inteira a cada requisição. Em nossos próprios logs, 96% dos tokens foram o agente relendo o próprio contexto.
Esta página cobre os comandos que mostram seu uso, os ajustes que mais o alteram e para onde os tokens realmente vão. As dicas vêm da documentação de custos da Anthropic. Os números vêm dos nossos próprios logs do Claude Code e de benchmarks publicados.
Como verifico o uso de tokens do Claude Code?
/usage: mostra a contagem de tokens e um custo estimado da sessão atual, uma linha sobre o cache de prompts e, nos planos Pro, Max, Team e Enterprise, suas barras de uso do plano. Também detalha o que está consumindo seu plano: skills, subagentes, plugins, servidores MCP e loops agendados, nas últimas 24 horas ou 7 dias./context: mostra o que está ocupando a janela de contexto agora, com dicas do que reduzir./insights: gera um relatório HTML sobre suas sessões recentes e onde você perde tempo e tokens.- A linha de status: um script pode exibir o custo, o contexto usado e os percentuais do seu plano de 5 horas e de 7 dias a cada prompt. Veja a documentação da linha de status.
- claude.ai Settings > Usage: limites do plano e gasto de créditos de uso, incluindo o uso em outros dispositivos.
Em um plano Pro ou Max, o valor em dólares do /usage é o que a sessão teria custado a preços de tabela da API, não o que você paga. Ainda assim, é a melhor medida única de quão pesada é uma sessão.
Para onde os tokens do Claude Code realmente vão?
Principalmente para reler o contexto. Cada requisição carrega a conversa completa, e cada chamada de ferramenta envia outra requisição com os resultados. Nos nossos logs do Claude Code, 7,0 bilhões de tokens de leitura de cache foram 96% de todos os tokens e metade de uma fatura equivalente em API de US$ 6.986. Os tokens de saída, a parte que você vê, ficaram abaixo de 1% do volume.
É por isso que uma pergunta de uma linha em uma sessão aberta o dia todo não é barata. Ela leva o dia inteiro junto. Nossa página de tokens por plano traz o detalhamento completo: cerca de 1,9 bilhão de tokens em uma semana de Max 20x e cerca de 39 milhões em uma sessão de Max 5x.
Como reduzo o uso de tokens do Claude Code?
Estas são as mudanças que mais alteram o uso, em ordem aproximada de efeito.
- Limpe entre tarefas sem relação.
/clearinicia um contexto novo e não custa nada. Use/renameantes se quiser fazer/resumeda sessão antiga depois. - Reduza o nível de esforço. No Opus 5.5, uma tarefa custou US$ 5,98 em esforço máximo e US$ 1,34 em esforço médio nas execuções da Artificial Analysis, uma diferença de 4,5x por uma única configuração. Use
/effortpara alterá-lo. Detalhes na nossa página de custo por nível de esforço. - Combine o modelo com o trabalho. A Anthropic recomenda o Sonnet para a maior parte da programação e o Opus para trabalho de arquitetura difícil ou de várias etapas. Troque com
/modele definamodel: haikuem subagentes simples. - Não faça pausas longas no meio da sessão. O cache de prompts dura uma hora em uma assinatura e cinco minutos com créditos de uso ou chave de API. Voltar depois que ele expira reprocessa todo o seu contexto a preço cheio.
- Mantenha saídas ruidosas fora do contexto principal. Envie execuções de testes, leitura de logs e busca de documentação para subagentes, para que volte apenas um resumo. Um hook pode filtrar um log de 10.000 linhas só para as linhas de erro antes que o Claude o veja.
- Reduza o que carrega na inicialização. Mantenha o CLAUDE.md abaixo de cerca de 200 linhas e mova instruções específicas de fluxo de trabalho para skills, que só carregam quando usadas. Desative os servidores MCP que você não usa com
/mcp. Prefira ferramentas de CLI comoghquando houver uma. - Escreva prompts específicos e planeje primeiro. «Melhore esta base de código» faz o Claude varrer tudo. O modo de plano (Shift+Tab) detecta uma abordagem errada antes que ela custe uma implementação completa.
- Fique de olho no trabalho em segundo plano. Loops agendados, colegas de equipe de agentes e subagentes ociosos continuam enviando todo o seu contexto. Equipes de agentes usam cerca de 7x os tokens de uma sessão normal quando os colegas rodam em modo de plano.
O /compact economiza tokens?
Apenas nas requisições seguintes, e compactar um contexto grande é, em si, uma requisição grande. O /compact lê a conversa inteira para resumi-la. Se você não precisa do histórico, /clear é mais barato. Se precisa, /compact com instruções (por exemplo /compact keep the API changes and failing tests) preserva o que importa. Você também pode definir um limite de compactação automática mais cedo com /autocompact.
Quanto custa o Claude Code por desenvolvedor?
A Anthropic informa cerca de US$ 13 por desenvolvedor por dia ativo e de US$ 150 a US$ 250 por mês em implantações corporativas, e menos de US$ 30 por dia para 90% dos usuários. Isso é cobrado a tarifas de API. Em uma assinatura, a pergunta passa a ser os limites de qual plano você atinge primeiro. Nossa página do limite semanal do Claude Max avalia uma semana de Max 20x em cerca de US$ 1,86 mil de uso equivalente em API.
Como as equipes acompanham o uso do Claude Code?
- Planos Team e Enterprise: o relatório de gastos na análise da organização, com um CSV por usuário. O Enterprise também tem uma API de análise. Os limites de gasto são definidos nas configurações de administração.
- API (Claude Console): a página de uso do Console e os limites de gasto por workspace.
- Qualquer configuração: defina
CLAUDE_CODE_ENABLE_TELEMETRY=1para exportar métricas de tokens e custo por usuário via OpenTelemetry para o seu próprio stack. Veja a documentação de monitoramento.
Se você paga tarifas contratadas, a configuração gerenciada modelPricing faz os valores de custo no /usage e no OpenTelemetry corresponderem ao seu contrato em vez do preço de tabela.
Fontes
- Claude Code docs: Manage costs effectively
- Claude Code docs: Status line
- Claude Code docs: Monitoring usage
- Artificial Analysis: model benchmarks and cost per task
Artigos relacionados
- Quantos tokens o Claude Pro e o Max oferecem
- Os níveis de esforço do Opus 5.5 são o preço real
- Claude Max 20x vs 5x: o limite semanal, medido
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →