Claude Sonnet 5.5: guia de roteamento de modelos por custo
Atualizado September 28, 2026 · publicado originalmente September 28, 2026
O Claude Sonnet 5.5 foi lançado em 28 de setembro de 2026 com as tarifas de API do Sonnet 5: US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. A Anthropic o posiciona para o trabalho cotidiano bem delimitado, correção de bugs, programação e documentos bem acabados, enquanto o Opus 5.5 se destina a trabalhos mais complexos que exigem julgamento cuidadoso. Para as equipes, a pergunta útil não é qual modelo vence um benchmark, mas qual atinge a meta de qualidade e latência de cada tarefa ao menor custo por resultado aceito.
A Anthropic diz que o Sonnet 5.5 é mais de 30% mais rápido que o Sonnet 5 e pode custar até 30% menos por tarefa. Essas são alegações de lançamento. Use-as para escolher o que avaliar, não como reduções automáticas de orçamento.
O que a Anthropic anunciou
- O Sonnet 5.5 mantém os preços de tabela da API do Sonnet 5: US$ 2/MTok de entrada, US$ 10/MTok de saída, US$ 2,50/MTok para gravações de cache de 5 minutos, US$ 4/MTok para gravações de 1 hora e US$ 0,20/MTok para leituras de cache.
- A Anthropic informa uma geração de saída mais de 30% mais rápida que a do Sonnet 5 e custo até 30% menor por tarefa na maior parte do trabalho, graças à eficiência de tokens.
- A empresa descreve o Sonnet como o mais forte em tarefas cotidianas bem delimitadas; o Opus foi projetado para tarefas complexas que exigem julgamento cuidadoso.
- A Anthropic diz que o Haiku 5.5 é esperado nas próximas semanas. Ele não fez parte do lançamento de hoje.
Consulte o anúncio de lançamento da Anthropic para ver as descrições completas dos benchmarks e suas ressalvas.
Uma política de roteamento para testar
| Carga de trabalho | Candidato inicial | O que medir |
|---|---|---|
| Alterações rotineiras de código, correção de bugs, edição de documentos | Sonnet 5.5 | Taxa de alterações aceitas, novas tentativas, tokens de saída, tempo decorrido |
| Trabalho ambíguo e de longo prazo com altos requisitos de julgamento | Comparar o Sonnet 5.5 com o Opus 5.5 | Qualidade em cada nível de esforço, frequência de escalonamento, custo de ponta a ponta |
| Classificação ou extração simples em alto volume | Comparar o Sonnet com modelos de menor custo que você já tem na sua stack | Limite de qualidade, custo por registro válido, tratamento de exceções |
| Trabalho interativo sensível à latência | Testar o Sonnet 5.5 no nível de esforço que atinge o padrão de qualidade | Latência de cauda, taxa de conclusão e custo por tarefa concluída |
Esta é uma matriz de testes, não uma afirmação de que um modelo seja sempre a escolha certa para uma categoria de carga de trabalho. O formato do prompt, o tamanho do contexto, o ambiente de ferramentas e os critérios de avaliação podem mudar o resultado.
Por que comparar apenas o preço de tabela é insuficiente
O preço por token do Sonnet 5.5 não caiu no lançamento. A economia potencial está em quantos tokens e etapas de agente ele precisa para concluir uma tarefa. Um modelo que gera uma resposta mais curta mas dispara mais chamadas de ferramentas pode custar mais no total; um modelo que termina mais rápido mas usa os mesmos tokens pode melhorar a capacidade de resposta sem alterar a conta de tokens.
Para um agente, calcule o total de uma tarefa como tokens de entrada × tarifa de entrada + tokens de saída × tarifa de saída + gravações/leituras de cache + quaisquer ferramentas ou infraestrutura cobradas separadamente. Compare o total somente depois de confirmar que a tarefa passa pelas mesmas verificações de aceitação.
Meça a migração antes de alterar seu orçamento
- Escolha algumas centenas de tarefas representativas, incluindo falhas e casos-limite.
- Execute o Sonnet 5 e o 5.5 com as mesmas ferramentas, prompts, limites de contexto e níveis de esforço sempre que possível.
- Registre as cobranças de tokens, novas tentativas, chamadas de ferramentas, tempo até a conclusão e aceitação humana.
- Compare o custo por tarefa aceita e relate os resultados por família de tarefas, não apenas como média global.
- Faça um canary das cargas de trabalho que atendem aos seus critérios. Mantenha um caminho de volta ao modelo anterior enquanto monitora qualidade e gastos.
Comece as projeções com zero economia presumida. Substitua essa suposição por variações medidas à medida que a avaliação produzir evidências. Para as tarifas de API e os preços de cache, use a documentação de preços da Anthropic.
FAQ
O Sonnet 5.5 é mais barato que o Sonnet 5?
As tarifas por token listadas são as mesmas. A Anthropic diz que ele pode custar até 30% menos por tarefa porque usa menos tokens, mas os resultados dependem da carga de trabalho.
O Sonnet 5.5 substitui o Opus 5.5?
Não. A Anthropic apresenta os modelos para perfis de tarefa diferentes. Avalie ambos onde a dificuldade da tarefa, o custo de uma falha ou os requisitos de qualidade justifiquem a comparação.
Está disponível na AWS?
A AWS anunciou a disponibilidade em 28 de setembro por meio do Amazon Bedrock e do Claude Platform on AWS. Verifique a região, o acesso ao modelo e os detalhes de preços atuais de cada serviço antes de planejar a implantação.
Fontes e leituras relacionadas
- Anthropic: Introducing Claude Sonnet 5.5
- AWS: Claude Sonnet 5.5 now available on AWS
- Preços do Sonnet 5.5 e modelo de custo por tarefa
- Modelo de custo do Claude Opus 5.5
Artigos relacionados
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →