Saltar para o conteúdo

Claude Haiku 5.5 e o limite de preço de 100k tokens

Atualizado October 8, 2026 · publicado originalmente October 8, 2026

Resposta rápida: O preço de vitrine do Claude Haiku 5.5 depende do tamanho do prompt. A Anthropic lançou o modelo em 7 de outubro de 2026 para trabalho de alto volume, como classificação, resumos e tarefas de...

O preço de vitrine do Claude Haiku 5.5 depende do tamanho do prompt. A Anthropic lançou o modelo em 7 de outubro de 2026 para trabalho de alto volume, como classificação, resumos e tarefas de subagentes. Sua janela de contexto de 1 milhão de tokens não garante que todos esses tokens custem a tarifa de prompts curtos: um prompt com mais de 100,000 tokens usa uma faixa de preço mais alta. Isso faz do tamanho da requisição uma decisão orçamentária, principalmente para agentes que acumulam documentos e resultados de ferramentas.

A tabela de preços tem dois lados

Os valores a seguir são os preços padrão publicados pela Anthropic para a API do Claude, em dólares americanos por milhão de tokens, conferidos em 8 de outubro. O limite é até 100,000 tokens de prompt versus mais de 100,000; não é um preço cobrado apenas sobre os tokens que excedem o limite. Consulte a documentação de preços atual antes de usar os números em uma previsão.

Categoria de tokenPrompt até 100kPrompt acima de 100k
Entrada sem cache$0.10$0.50
Saída$0.50$2.50
Escrita em cache de 5 minutos$0.125$0.625
Escrita em cache de 1 hora$0.20$1.00
Leitura de cache$0.01$0.05

Cada tarifa de token listada é cinco vezes maior acima do limite. Isso não significa que toda a fatura de uma aplicação aumenta cinco vezes: muitas chamadas podem continuar curtas, e o volume de saída, o cache, as ferramentas, o processamento em lote, as novas tentativas e o sucesso das tarefas afetam o gasto total. O contexto em cache continua ocupando o prompt; um acerto de cache não transforma uma requisição de 120k tokens em um prompt curto.

Como o limite aparece em uma única requisição

Considere duas chamadas ilustrativas, sem cache nem ferramentas cobradas separadamente, cada uma produzindo 1,000 tokens de saída. Um prompt de 99,000 tokens custa cerca de $0.0104 em entrada mais saída nas tarifas de prompt curto. Um prompt de 101,000 tokens custa cerca de $0.0530 nas tarifas de prompt longo. É aproximadamente cinco vezes mais por uma requisição com apenas 2,000 tokens de entrada a mais. O exemplo mantém a saída fixa para isolar o limite de preço; não é uma economia medida em produção. Prompts reais também incluem instruções de sistema, histórico de conversa, esquemas de ferramentas e resultados de ferramentas.

Reconte antes de migrar

As notas de migração da Anthropic dizem que o mesmo texto gera aproximadamente 30% mais tokens no Haiku 5.5 do que no Haiku 4.5, com variação conforme o conteúdo. Um prompt que parecia confortavelmente abaixo de 100k com as contagens antigas pode cruzar o novo limite. Não multiplique todas as contagens antigas por 1.3 e trate o resultado como previsão de fatura; reconte requisições representativas com claude-haiku-5-5.

O endpoint de contagem de tokens da Anthropic aceita a mensagem estruturada, o prompt de sistema e as ferramentas de cliente compatíveis antes do envio da requisição de geração. Conte com o modelo de destino e registre o uso real depois da resposta. A contagem prévia é uma estimativa e pode diferir um pouco da entrada faturada; algumas ferramentas de servidor e blocos de URL ou arquivo não são compatíveis com o contador. Nesses caminhos, baseie-se no uso observado das requisições e mantenha uma margem de segurança perto do limite.

Uma regra de orçamento de prompt para subagentes

  1. Meça a distribuição. Registre as contagens de tokens de prompt do Haiku 5.5 por carga de trabalho, ID do modelo e resultado da tarefa. Observe quantas chamadas se concentram perto de 100k ou o ultrapassam, em vez de olhar apenas a média.
  2. Avise antes do limite. Sinalize requisições próximas do limite no orquestrador de agentes. Trate o nível de aviso como sua própria margem operacional, não como uma regra de preço da Anthropic.
  3. Reduza a causa. Remova trechos de recuperação duplicados, limite o tamanho dos resultados de ferramentas ou compacte históricos antigos onde os testes de qualidade permitirem. Não descarte evidências de que um agente precisa só para economizar tokens.
  4. Compare a cauda longa. Para prompts longos inevitáveis, teste o Haiku na faixa mais alta contra outra rota nas mesmas tarefas. Compare custo por resultado aceito, latência e frequência de fallback, e não apenas os preços de tabela.
  5. Concilie com a fatura. Precifique a entrada, a saída e as leituras e escritas de cache reais na faixa aplicável e depois inclua ferramentas e novas tentativas. Reverifique as tarifas do provedor ou da plataforma de nuvem e quaisquer descontos contratuais.

O Haiku 5.5 ainda pode ser a melhor escolha acima de 100k, mas isso deve ser uma decisão de roteamento medida. O controle importante é saber quais requisições cruzam a linha e por quê.

Perguntas que as equipes fazem

O preço mais alto se aplica apenas aos tokens acima de 100k?

Não. A Anthropic descreve o Haiku 5.5 como precificado pelo tamanho do prompt: um prompt com mais de 100,000 tokens paga as tarifas publicadas mais altas por aquela requisição.

O cache de prompt pode manter uma requisição longa na faixa mais barata?

Não. Tokens reutilizados podem receber a tarifa de leitura de cache, mas o contexto em cache continua ocupando o tamanho do prompt. Conte o prompt inteiro ao verificar o limite.

Um aumento de 30% do tokenizador é garantido?

Não. A Anthropic diz aproximadamente 30% mais tokens para o mesmo texto do que no Haiku 4.5, dependendo do conteúdo. Conte seus próprios prompts no modelo de destino.

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com