Modelo de custo do Claude Opus 5.5
Updated September 22, 2026 · first published September 22, 2026
Anthropic lançou Claude Opus 5.5 (claude-opus-5-5) em 22 de setembro de 2026. O preço anunciado é de $4 por milhão de tokens de entrada e $20 por milhão de tokens de saída, reduzido de $5 e $25 no Opus 5. Isso é um corte de 20%. Para a maioria das cargas de trabalho de produção, o corte real é maior, porque a taxa que mais se moveu é a que o título omite.
As taxas que importam
| Tipo de token | Opus 5.5 | Opus 5 | Fable 5.1 |
|---|---|---|---|
| Entrada (sem cache) | $4.00 / MTok | $5.00 / MTok | $10.00 / MTok |
| Saída | $20.00 / MTok | $25.00 / MTok | $50.00 / MTok |
| Escrita em cache (5 min) | $5.00 / MTok | $6.25 / MTok | $12.50 / MTok |
| Leitura de cache | $0.20 / MTok | $0.50 / MTok | $0.25 / MTok |
| Modo rápido (entrada / saída) | $8 / $40 | — | — |
Cada linha é 20% mais baixa exceto a leitura de cache, que é 60% mais barata. A $0.20 agora é mais barato que o $0.25 do Fable 5.1. Isso inverte a única linha onde Fable costumava ganhar. Em nosso modelo de custo Fable 5.1, uma carga de trabalho muito em cache poderia sair mais barata no Fable do que no Opus 5. Contra Opus 5.5, isso não acontece mais. Fable custa mais em cada tipo de token.
Por que uma tarefa típica custa cerca de 40% menos
A alegação de Anthropic é uma queda de 40% no custo para um trabalho típico, não 20%. O extra vem da eficiência de tokens. Anthropic diz que Opus 5.5 alcança o mesmo resultado com cerca de 20% menos tokens de entrada e saída e escreve cerca de 40% menos saída verbosa. Uma taxa mais baixa vezes menos tokens se compõe: 0.8 × 0.8 = 0.64, que é aproximadamente 36–40% de desconto dependendo da mistura.
Aqui está uma etapa de agente: 200.000 tokens de entrada, 90% servidos do cache, e 20.000 tokens de saída.
| Linha | Opus 5 | Opus 5.5 (mesmos tokens) | Fable 5.1 |
|---|---|---|---|
| 20K entrada sem cache | $0.100 | $0.080 | $0.200 |
| 180K entrada em cache | $0.090 | $0.036 | $0.045 |
| 20K saída | $0.500 | $0.400 | $1.000 |
| Total | $0.690 | $0.516 | $1.245 |
Em tokens idênticos, Opus 5.5 é 25% mais barato que Opus 5, não 20%, por causa do desconto de cache. Se a redução de 20% de tokens se mantiver para sua carga de trabalho, a etapa cai para cerca de $0.41, que é 40% abaixo de Opus 5 e um terço do custo de Fable. A saída ainda é cerca de 80% da fatura neste exemplo. É aí que a redução de verbosidade compensa.
Custo por tarefa contra GPT-6 Sol, GPT-6 Astra e Fable 5.1
Preços de tabela por milhão de tokens e o mesmo passo de agente de cima (200K de entrada, 90% em cache, 20K de saída) calculado em cada modelo.
| Modelo | Entrada $/MTok | Saída $/MTok | Leitura de cache $/MTok | Mesmo passo de agente |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $0.276 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $0.516 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $0.690 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $1.245 |
| GPT-6 Astra | $10.00 | $50.00 | $1.00 | $1.380 |
Custo por tarefa medido no Artificial Analysis Intelligence Index v4.3.2, consultado em 22 de setembro de 2026, ordenado por pontuação. O GPT-6 Sol é a forma mais barata de chegar a qualquer pontuação até 47,5. Acima disso, o Opus 5.5 é o mais barato em todos os níveis: o Opus 5.5 high pontua 53,6 por US$ 1,82, enquanto o GPT-6 Astra max pontua 52,7 por US$ 3,26 e o Fable 5.1 max pontua 53,4 por US$ 7,63.
| Modelo | Intelligence Index | Custo por tarefa | Tokens de saída por tarefa |
|---|---|---|---|
| GPT-6 Sol · medium | 39.8 | $0.25 | 6,500 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | 16,000 |
| GPT-6 Astra · low | 45.8 | $0.82 | 4,400 |
| GPT-6 Sol · max | 47.5 | $1.06 | 31,200 |
| Claude Opus 5 · high | 48.1 | $3.61 | 46,200 |
| Claude Opus 5 · max | 50.8 | $5.86 | 72,500 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | 25,700 |
| Claude Fable 5.1 · high | 51.2 | $3.91 | 38,100 |
| GPT-6 Astra · max | 52.7 | $3.26 | 27,200 |
| Claude Fable 5.1 · max | 53.4 | $7.63 | 78,100 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | 35,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | 119,200 |
Todas as configurações do GPT-6 Astra acima de low, todas as do Opus 5 e todas as do Fable 5.1 custam mais do que uma configuração do Sol ou do Opus 5.5 com pontuação igual ou maior. O custo por tarefa depende da mistura de tarefas do benchmark. Reproduza o seu próprio tráfego antes de trocar de modelo.
É bom o bastante para substituir Fable?
Anthropic posiciona Opus 5.5 como correspondendo a Fable 5.1 na maioria das tarefas. Os números publicados apoiam isso para trabalho de codificação e agentivo:
- Terminal-Bench 4.0: 66.4%, contra 52.3% para Opus 5 e 55.8% para Fable 5.1.
- FrontierCode v1.1: 54.4%, contra 48.0% para Opus 5 e 50.3% para Fable 5.1.
- CursorBench 4.0: 57.8%, contra 46.6% para Opus 5.
- GDPval-AA v2.1: 1846 Elo, contra 1708 para Opus 5.
Artificial Analysis o classificou em primeiro lugar no seu Índice de Inteligência no dia do lançamento. Anthropic também diz que no esforço padrão (médio), ele supera GPT-6 Astra no esforço máximo em trabalho de conhecimento por cerca de um quinto do custo por tarefa. Essa é uma comparação de fornecedor, então trate-a como uma hipótese a testar. A matemática de custos acima é a parte que você pode verificar por conta própria.
Modo rápido custa 2×
O modo rápido custa $8 de entrada e $40 de saída, exatamente o dobro da taxa padrão, por até 2.5× a velocidade. O modelo padrão também é cerca de 30% mais rápido que Opus 5. Use o modo rápido para caminhos interativos vinculados à latência onde um usuário está esperando. Mantenha-o desligado para trabalhos em lote, agentes em segundo plano e avaliações. Quando o modo rápido está habilitado por padrão, o custo unitário dobra e o painel não mostra nada incomum até que a fatura chega.
O que fazer esta semana
- Fixe o ID do modelo. Aponte a produção para
claude-opus-5-5explicitamente e registre o ID em cada solicitação, para que o custo por solicitação possa ser dividido por modelo após a migração. - Re-calibre em seu próprio tráfego. Reproduza uma amostra de solicitações reais em ambos os modelos e compare tokens por tarefa completada, não por chamada. A afirmação de eficiência de 20% de tokens é a parte mais propensa a variar por carga de trabalho.
- Re-verifique as configurações de esforço. Se uma carga de trabalho se moveu para Fable ou para esforço máximo por qualidade, teste Opus 5.5 no nível médio primeiro. Essa é a configuração contra a qual Anthropic faz benchmark.
- Re-execute a decisão de roteamento de Fable. Qualquer rota que enviou tráfego pesado em cache para Fable para obter a leitura de cache mais barata deve ser reavaliada. Essa vantagem de custo desapareceu.
- Monitore a taxa de acerto do cache. A $0.20 contra $4.00, uma falha de cache agora custa 20× um acerto. Uma mudança de modelo de prompt que quebra o prefixo custa mais que no Opus 5.
Anthropic diz que Sonnet 5.5 e Haiku 5.5 seguirão nas próximas semanas. Mantenha o arnês de repetição da etapa 2 para que cada lançamento possa ser re-calibrado em uma tarde.
Related
- Modelo de custo do Claude Fable 5.1
- Economia de cache de prompt
- Níveis de esforço do Opus 5.5 são o preço real
- Economia do modo rápido Opus 5.5
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →