Custo real por tarefa nos modelos de fronteira
Updated September 22, 2026 · first published September 22, 2026
Preços de tabela dizem quanto custa um token. Não dizem quanto custa uma tarefa concluída, porque os modelos gastam quantidades muito diferentes de tokens para fazer o mesmo trabalho. Esta página coloca lado a lado o custo por tarefa medido e uma pontuação de qualidade para Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra e GPT-6 Sol em cada nível de esforço. Todo número tem fonte e nada é estimado.
A resposta curta: o GPT-6 Sol é o jeito mais barato de chegar a qualquer pontuação até 47,5. Acima de 47,5, o Opus 5.5 é o mais barato em todos os níveis. Nenhuma configuração do GPT-6 Astra acima de low, do Opus 5 ou do Fable 5.1 é eficiente em custo: cada uma perde em pontuação e em preço para alguma configuração do Sol ou do Opus 5.5.
Método
Todas as pontuações e custos vêm do Artificial Analysis Intelligence Index v4.3.2, consultado em 22 de setembro de 2026. O índice roda dez avaliações: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR. A Artificial Analysis roda cada modelo em cada nível de esforço pela API do fornecedor e registra quanto paga a preço de tabela. O custo por tarefa é esse gasto por tarefa, dividido em entrada e saída. Todas as linhas rodam a mesma suíte, então se comparam diretamente.
Há dois limites antes de ler os números. Primeiro, o índice é uma única mistura de tarefas. A sua mistura vai mudar os custos, e por isso a última seção explica como medir os seus. Segundo, pontuações de versões diferentes do índice não se comparam, então não misture estes números com resultados publicados antes.
A escala completa: 26 configurações
Tokens de saída por tarefa são os tokens que o modelo escreve, incluindo o raciocínio. A Artificial Analysis não publica a divisão entre entrada e saída para as quatro configurações intermediárias do GPT-6 Sol, por isso essas células mostram n/a.
| Modelo | Esforço | Intelligence Index | Custo por tarefa | Custo de entrada | Custo de saída | Tokens de saída por tarefa | Na fronteira |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | Não |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | Sim |
| GPT-6 Sol | medium (padrão) | 39.8 | $0.25 | n/a | n/a | 6,500 | Sim |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | Sim |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | Sim |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | Sim |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | Sim |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | Não |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | Não |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | Não |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | Não |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | Não |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | Não |
| Claude Opus 5 | high (padrão) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | Não |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | Não |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | Não |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | Não |
| Claude Opus 5.5 | medium (padrão) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | Sim |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | Sim |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | Sim |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | Sim |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | Não |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | Não |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | Não |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | Não |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | Não |
Na fronteira significa que nenhuma outra configuração desta tabela pontua mais por menos dinheiro.
A fronteira de custo
Dez das 26 configurações estão na fronteira. Ordenadas por custo, são as únicas que valem a pena considerar só pelo preço. Todas as outras pagam mais pela mesma pontuação ou por uma menor.
| Configuração | Intelligence Index | Custo por tarefa | Por 10.000 tarefas |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
A fronteira tem duas regiões. De US$ 0,13 a US$ 1,06 é quase só GPT-6 Sol, com o GPT-6 Astra low como única exceção, a US$ 0,82. De US$ 1,34 para cima é só Opus 5.5. O salto entre as duas é pequeno: o Opus 5.5 medium pontua 3,7 pontos a mais que o Sol max por US$ 0,28 a mais por tarefa.
Frente a frente com pontuação igual ou melhor
Cada par compara uma configuração mais barata com uma mais cara que pontua igual ou menos.
| Configuração mais barata | Configuração mais cara | Diferença de pontuação | Economia |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | +3.1 para Opus 5.5 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | +0.4 para Opus 5.5 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | empate | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | +0.9 para Opus 5.5 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | +0.2 para Opus 5.5 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | +0.6 para Opus 5 | 71% |
A linha do Opus 5 importa para equipes que ainda não migraram. O Opus 5 rodava por padrão em esforço high. O Opus 5.5 roda por padrão em medium e, nesse padrão, pontua 3,1 pontos a mais por 63% menos por tarefa. A Anthropic diz que o Opus 5.5 é 40% mais barato que o Opus 5; a diferença medida neste índice é maior que a promessa.
Para onde vai o dinheiro: entrada, não saída
Em todos os modelos, a entrada fica entre metade e três quartos do custo por tarefa. No Opus 5.5 medium, US$ 0,82 dos US$ 1,34 são entrada, ou 61%. No GPT-6 Astra max são 58%, no GPT-6 Sol max 70% e no Fable 5.1 max 49%. Tarefas de agente reenviam o contexto crescente a cada passo, então o gasto com entrada cresce com o número de passos, não só com o tamanho da resposta.
É por isso que o GPT-6 Sol sem raciocínio custa mais que em low: US$ 0,33 contra US$ 0,13, embora escreva só 4.900 tokens de saída. US$ 0,28 dos US$ 0,33 são entrada. A causa provável são mais passos, cada um reenviando o contexto. Desligar o raciocínio não barateia um agente se ele depois precisa de mais turnos.
Para a sua fatura, isso significa que o cache importa tanto quanto a escolha do modelo. Opus 5.5 e GPT-6 Sol cobram US$ 0,20 por milhão de tokens de entrada em cache. O GPT-6 Astra cobra US$ 1,00 e o Opus 5 cobra US$ 0,50.
Volume de tokens contra preço de tabela
O GPT-6 Astra é o modelo mais econômico em tokens aqui. Em esforço max ele escreve 27.200 tokens de saída por tarefa, contra 119.200 do Opus 5.5 max. Mas o Astra cobra US$ 10 e US$ 50 por milhão, 2,5× a tarifa do Opus 5.5. O preço de tabela vence: o Opus 5.5 high custa US$ 1,82 por tarefa e pontua 53,6, enquanto o Astra max custa US$ 3,26 e pontua 52,7.
O Opus 5.5 max é o único ponto onde a verbosidade pesa. Seus 119.200 tokens de saída custam US$ 2,38 antes de qualquer entrada, e a tarefa inteira custa US$ 5,98. Isso compra a maior pontuação da tabela, 57,6, mas por 4,5× o custo do medium.
Retornos decrescentes por esforço
Cada linha mostra o que um nível a mais de esforço compra, em pontos de índice contra o custo extra por tarefa.
| Modelo | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +3.0 pontos por +48% | +3.4 pontos por +100% |
| GPT-6 Astra | +1.3 pontos por +12% | +0.3 pontos por +41% |
| Claude Opus 5 | +3.3 pontos por +65% | +1.1 pontos por +20% |
| Claude Opus 5.5 | +2.4 pontos por +36% | +1.6 pontos por +73% |
| Claude Fable 5.1 | +2.3 pontos por +31% | +0.2 pontos por +28% |
No Fable 5.1 e no GPT-6 Astra, o esforço max quase não compra nada: 0,2 e 0,3 ponto por 28% e 41% a mais. No Opus 5.5, subir para max ainda compra 1,6 ponto, mas custa 73% a mais. Use max só em tarefas onde você mediu que os pontos extras mudam o resultado.
Quando o GPT-6 Sol max basta
O índice é uma média, e a diferença entre o Sol max e o Opus 5.5 medium não é uniforme. Pontuações por avaliação da Artificial Analysis:
| Avaliação | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
Em AutomationBench e CritPt, o GPT-6 Sol empata ou supera o Opus 5.5 medium por US$ 1,06 por tarefa contra US$ 1,34. Em Terminal-Bench, nas avaliações de trabalho do conhecimento e no Humanity's Last Exam, o Opus 5.5 lidera com folga. Automação de fluxos de trabalho pode rodar no Sol. Agentes de terminal e de código e trabalho do conhecimento com muitos documentos são onde o Opus 5.5 justifica o preço.
Números do fornecedor contra números independentes
Números de fornecedor e números independentes costumam divergir, porque usam outros harnesses e outras configurações. A Anthropic informa 66,4% no Terminal-Bench 4.0 para o Opus 5.5 em xhigh. A Artificial Analysis mede 59,6% no mesmo esforço.
| Esforço | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
O ranking também muda com o índice. No Vals AI Index, o Fable 5.1 é o primeiro com 68,83%, o GPT-6 Astra o terceiro com 66,61% e o Opus 5.5 o quarto com 66,16%. Lá o custo por tarefa não é publicado na mesma base, então isso não mexe na fronteira acima. É um lembrete de que um índice é só uma visão.
Preços de tabela e uma tarefa com muito cache
A Digital Applied calculou o preço de uma tarefa de agente com muito cache em cada modelo: 8M tokens de leitura de cache, 400K de entrada sem cache, 600K de escrita em cache e 300K de saída. O resultado segue a fronteira, com uma penalidade extra para o GPT-6 Astra.
| Modelo | Entrada $/MTok | Saída $/MTok | Leitura de cache $/MTok | Tarefa com muito cache (Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
O GPT-6 Astra cobra a requisição inteira a US$ 20 e US$ 75 por milhão quando a entrada passa de 272K tokens. O Opus 5.5 mantém um único preço em toda a janela de 1M tokens. No Opus 5.5, escrever no cache custa US$ 5 por milhão no cache de 5 minutos e US$ 8 no de 1 hora, lotes são cobrados a 50% e o modo rápido dobra o preço. Para os detalhes, veja o Modelo de custos do Claude Opus 5.5 e a Economia do modo rápido do Opus 5.5.
Como medir o seu próprio custo por tarefa
- Registre tokens por tarefa, não por requisição: entrada sem cache, entrada em cache, escritas em cache e saída, somados em todos os passos da tarefa.
- Pegue uma amostra de algumas centenas de tarefas reais e rode de novo em duas ou três configurações candidatas, por exemplo Sol max, Opus 5.5 medium e Opus 5.5 high.
- Avalie cada resultado com a mesma verificação que você usa em produção e conte as tarefas aprovadas.
- Divida o gasto total pelas tarefas aprovadas. O custo por tarefa bem-sucedida é o número a comparar, porque uma configuração barata que falha mais não é barata.
- Escolha a configuração mais barata que atinge sua régua de qualidade e mande só as tarefas que falham para uma configuração mais alta.
- Refaça o teste quando um preço ou um esforço padrão mudar.
Para ver como o esforço muda a fatura de um mesmo modelo, veja Os níveis de esforço do Opus 5.5 são o preço real.
Ressalvas
- Todos os custos são a preço de tabela da API sobre a mistura de tarefas da Artificial Analysis. Descontos, lotes e o seu próprio cache mudam esses valores.
- A Artificial Analysis marca as entradas do Opus 5.5 e do Fable 5.1 como Default Fallback. Leia as notas de metodologia antes de tratar todas as linhas como a mesma configuração de API.
- As pontuações são só da versão v4.3.2 do índice. Versões anteriores usavam outras avaliações e não se comparam.
- A tarefa com muito cache da Digital Applied é uma carga ilustrativa, não uma medição.
- Os números mudam quando os fornecedores mudam preços ou padrões. A data de consulta é 22 de setembro de 2026.
Fontes
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
- Modelo de custos do Claude Opus 5.5
- Os níveis de esforço do Opus 5.5 são o preço real
- Economia do modo rápido do Opus 5.5
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →