Saltar para o conteúdo

Claude Sonnet 5.5: guia de roteamento de modelos por custo

Atualizado September 28, 2026 · publicado originalmente September 28, 2026

O Claude Sonnet 5.5 foi lançado em 28 de setembro de 2026 com as tarifas de API do Sonnet 5: US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. A Anthropic o posiciona para o trabalho cotidiano bem delimitado, correção de bugs, programação e documentos bem acabados, enquanto o Opus 5.5 se destina a trabalhos mais complexos que exigem julgamento cuidadoso. Para as equipes, a pergunta útil não é qual modelo vence um benchmark, mas qual atinge a meta de qualidade e latência de cada tarefa ao menor custo por resultado aceito.

A Anthropic diz que o Sonnet 5.5 é mais de 30% mais rápido que o Sonnet 5 e pode custar até 30% menos por tarefa. Essas são alegações de lançamento. Use-as para escolher o que avaliar, não como reduções automáticas de orçamento.

O que a Anthropic anunciou

Consulte o anúncio de lançamento da Anthropic para ver as descrições completas dos benchmarks e suas ressalvas.

Uma política de roteamento para testar

Carga de trabalhoCandidato inicialO que medir
Alterações rotineiras de código, correção de bugs, edição de documentosSonnet 5.5Taxa de alterações aceitas, novas tentativas, tokens de saída, tempo decorrido
Trabalho ambíguo e de longo prazo com altos requisitos de julgamentoComparar o Sonnet 5.5 com o Opus 5.5Qualidade em cada nível de esforço, frequência de escalonamento, custo de ponta a ponta
Classificação ou extração simples em alto volumeComparar o Sonnet com modelos de menor custo que você já tem na sua stackLimite de qualidade, custo por registro válido, tratamento de exceções
Trabalho interativo sensível à latênciaTestar o Sonnet 5.5 no nível de esforço que atinge o padrão de qualidadeLatência de cauda, taxa de conclusão e custo por tarefa concluída

Esta é uma matriz de testes, não uma afirmação de que um modelo seja sempre a escolha certa para uma categoria de carga de trabalho. O formato do prompt, o tamanho do contexto, o ambiente de ferramentas e os critérios de avaliação podem mudar o resultado.

Por que comparar apenas o preço de tabela é insuficiente

O preço por token do Sonnet 5.5 não caiu no lançamento. A economia potencial está em quantos tokens e etapas de agente ele precisa para concluir uma tarefa. Um modelo que gera uma resposta mais curta mas dispara mais chamadas de ferramentas pode custar mais no total; um modelo que termina mais rápido mas usa os mesmos tokens pode melhorar a capacidade de resposta sem alterar a conta de tokens.

Para um agente, calcule o total de uma tarefa como tokens de entrada × tarifa de entrada + tokens de saída × tarifa de saída + gravações/leituras de cache + quaisquer ferramentas ou infraestrutura cobradas separadamente. Compare o total somente depois de confirmar que a tarefa passa pelas mesmas verificações de aceitação.

Meça a migração antes de alterar seu orçamento

  1. Escolha algumas centenas de tarefas representativas, incluindo falhas e casos-limite.
  2. Execute o Sonnet 5 e o 5.5 com as mesmas ferramentas, prompts, limites de contexto e níveis de esforço sempre que possível.
  3. Registre as cobranças de tokens, novas tentativas, chamadas de ferramentas, tempo até a conclusão e aceitação humana.
  4. Compare o custo por tarefa aceita e relate os resultados por família de tarefas, não apenas como média global.
  5. Faça um canary das cargas de trabalho que atendem aos seus critérios. Mantenha um caminho de volta ao modelo anterior enquanto monitora qualidade e gastos.

Comece as projeções com zero economia presumida. Substitua essa suposição por variações medidas à medida que a avaliação produzir evidências. Para as tarifas de API e os preços de cache, use a documentação de preços da Anthropic.

FAQ

O Sonnet 5.5 é mais barato que o Sonnet 5?

As tarifas por token listadas são as mesmas. A Anthropic diz que ele pode custar até 30% menos por tarefa porque usa menos tokens, mas os resultados dependem da carga de trabalho.

O Sonnet 5.5 substitui o Opus 5.5?

Não. A Anthropic apresenta os modelos para perfis de tarefa diferentes. Avalie ambos onde a dificuldade da tarefa, o custo de uma falha ou os requisitos de qualidade justifiquem a comparação.

Está disponível na AWS?

A AWS anunciou a disponibilidade em 28 de setembro por meio do Amazon Bedrock e do Claude Platform on AWS. Verifique a região, o acesso ao modelo e os detalhes de preços atuais de cada serviço antes de planejar a implantação.

Fontes e leituras relacionadas

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com