Saltar para o conteúdo

Preço do Claude Sonnet 5.5: o que muda e o que não muda

Atualizado September 28, 2026 · publicado originalmente September 27, 2026

O Claude Sonnet 5.5 custa $2 por milhão de tokens de entrada e $10 por milhão de tokens de saída na API da Anthropic, o mesmo preço de tabela do Sonnet 5. A mudança econômica está na eficiência: a Anthropic afirma que o Sonnet 5.5 pode custar até 30% menos por tarefa porque usa menos tokens, além de gerar a saída mais de 30% mais rápido. Esse é um máximo informado pelo fornecedor, não um desconto garantido em todas as cargas de trabalho.

Para uma previsão de orçamento, mantenha as tarifas por token fixas e modele separadamente a possível redução de tokens e de passos do agente. Meça o seu próprio mix de tarefas antes de aplicar qualquer premissa de economia.

Preços da API do Sonnet 5.5

Tipo de tokenPreço por milhão
Entrada$2.00
Saída$10.00
Escrita em cache de 5 minutos$2.50
Escrita em cache de 1 hora$4.00
Leitura de cache$0.20

A Anthropic divulga essas tarifas no anúncio de lançamento do Sonnet 5.5. Não interprete «até 30% menos por tarefa» como uma redução de 30% nas tarifas por token: os preços de entrada e saída são os mesmos do Sonnet 5. O preço de $2/$10 do Sonnet 5 também passou a ser o padrão, depois que a Anthropic cancelou o aumento que havia planejado para setembro.

Exemplo: eficiência de tokens versus mudança de tarifa

Considere uma tarefa que usa 100,000 tokens de entrada e 10,000 de saída, sem cache. Nas tarifas publicadas do Sonnet 5.5, são $0.20 de entrada mais $0.10 de saída, ou $0.30 por tarefa. Se a mesma tarefa usasse 30% menos tokens nas duas categorias, o custo modelado seria de $0.21. É uma ilustração da aritmética, não uma promessa de que toda tarefa usará 30% menos tokens.

Para uma carga de 10,000 tarefas assim por mês, a linha de base é de $3,000. Uma redução de 30% no volume de tokens economizaria $900 e levaria a conta mensal modelada a $2,100. Os resultados reais variam conforme o tamanho do prompt, o reaproveitamento de cache, o tamanho da saída, o esforço de raciocínio, as novas tentativas e as chamadas de ferramentas.

O que os benchmarks do lançamento mostram e não mostram

A Anthropic relata ganhos em suas avaliações de programação e de trabalho do conhecimento, incluindo Terminal-Bench 4.0 e CursorBench. A empresa também informa que o Sonnet 5.5 gera saída mais de 30% mais rápido que o Sonnet 5 e que, em várias comparações, atinge as pontuações anteriores do Sonnet 5 por uma fração do custo por tarefa. Esses resultados são boas hipóteses para um plano de avaliação, mas são medições publicadas pelo fornecedor, não dados independentes de custo em produção.

Um alerta prático: um modelo mais rápido não reduz automaticamente uma fatura de API cobrada por token. A fatura cai quando o uso por tarefa concluída diminui, ou quando menos tarefas exigem novas tentativas ou escalonamento. A geração mais rápida pode, em vez disso, melhorar a vazão ou reduzir a latência sem alterar o gasto com tokens.

Uma forma segura de prever a adoção

  1. Mantenha a tabela de tarifas constante. Use $2/$10 por milhão de tokens de entrada/saída como ponto de partida para o Sonnet 5 e o 5.5.
  2. Meça o trabalho concluído. Compare o custo por tarefa aceita, não apenas tokens por requisição. Inclua novas tentativas, chamadas de ferramentas e retrabalho humano sempre que possível.
  3. Separe por carga de trabalho. Avalie programação, suporte, extração e tarefas de contexto longo separadamente; uma única taxa de economia combinada pode esconder regressões.
  4. Use uma faixa. Orce com 0% de economia até que os testes internos tragam evidências e só então acrescente cenários medidos. Trate o «até 30%» da Anthropic como uma afirmação de limite superior, não como a sua previsão.
  5. Reverifique qualidade e latência. Uma fatura de tokens menor não é economia se a taxa de aceitação cair ou se forem necessários modelos de contingência mais caros.

FAQ

O Sonnet 5.5 ficou mais barato por token?

Não. A Anthropic informa as mesmas tarifas do Sonnet 5: $2 de entrada e $10 de saída por milhão de tokens. A alegação de custo por tarefa vem do uso de menos tokens para fazer um trabalho comparável.

A economia de 30% é garantida?

Não. A Anthropic descreve reduções de custo de até 30% para a maior parte do trabalho em seus materiais de lançamento. O seu resultado depende da carga de trabalho, do prompt caching, das configurações de esforço e da qualidade de conclusão das tarefas.

Quanto custa uma requisição com cache?

A Anthropic lista leituras de cache a $0.20 por milhão de tokens, escritas de 5 minutos a $2.50 e escritas de 1 hora a $4.00. Consulte a documentação de preços da API do Claude atual antes de fechar uma previsão.

Devemos migrar o tráfego de produção imediatamente?

Execute primeiro uma avaliação representativa. Rode o modelo em shadow ou canary, compare o custo por resultado aceito e a latência, e mantenha uma rota de reversão para as cargas que regredirem.

Fontes e leituras relacionadas

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com