Custo real por tarefa nos modelos de fronteira

Updated September 22, 2026 · first published September 22, 2026

Preços de tabela dizem quanto custa um token. Não dizem quanto custa uma tarefa concluída, porque os modelos gastam quantidades muito diferentes de tokens para fazer o mesmo trabalho. Esta página coloca lado a lado o custo por tarefa medido e uma pontuação de qualidade para Claude Opus 5.5, Claude Opus 5, Claude Fable 5.1, GPT-6 Astra e GPT-6 Sol em cada nível de esforço. Todo número tem fonte e nada é estimado.

A resposta curta: o GPT-6 Sol é o jeito mais barato de chegar a qualquer pontuação até 47,5. Acima de 47,5, o Opus 5.5 é o mais barato em todos os níveis. Nenhuma configuração do GPT-6 Astra acima de low, do Opus 5 ou do Fable 5.1 é eficiente em custo: cada uma perde em pontuação e em preço para alguma configuração do Sol ou do Opus 5.5.

Método

Todas as pontuações e custos vêm do Artificial Analysis Intelligence Index v4.3.2, consultado em 22 de setembro de 2026. O índice roda dez avaliações: AA-Briefcase, GDPval-AA, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience e AA-LCR. A Artificial Analysis roda cada modelo em cada nível de esforço pela API do fornecedor e registra quanto paga a preço de tabela. O custo por tarefa é esse gasto por tarefa, dividido em entrada e saída. Todas as linhas rodam a mesma suíte, então se comparam diretamente.

Há dois limites antes de ler os números. Primeiro, o índice é uma única mistura de tarefas. A sua mistura vai mudar os custos, e por isso a última seção explica como medir os seus. Segundo, pontuações de versões diferentes do índice não se comparam, então não misture estes números com resultados publicados antes.

A escala completa: 26 configurações

Tokens de saída por tarefa são os tokens que o modelo escreve, incluindo o raciocínio. A Artificial Analysis não publica a divisão entre entrada e saída para as quatro configurações intermediárias do GPT-6 Sol, por isso essas células mostram n/a.

ModeloEsforçoIntelligence IndexCusto por tarefaCusto de entradaCusto de saídaTokens de saída por tarefaNa fronteira
GPT-6 Solnone28.1$0.33$0.28$0.054,900Não
GPT-6 Sollow33.9$0.13n/an/a3,400Sim
GPT-6 Solmedium (padrão)39.8$0.25n/an/a6,500Sim
GPT-6 Solhigh42.8$0.37n/an/a10,200Sim
GPT-6 Solxhigh44.1$0.53n/an/a16,000Sim
GPT-6 Solmax47.5$1.06$0.74$0.3131,200Sim
GPT-6 Astralow45.8$0.82$0.60$0.224,400Sim
GPT-6 Astramedium49.6$1.54$1.06$0.489,600Não
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800Não
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900Não
GPT-6 Astramax52.7$3.26$1.90$1.3627,200Não
Claude Opus 5low39.4$1.10$0.73$0.3714,700Não
Claude Opus 5medium44.8$2.19$1.47$0.7229,000Não
Claude Opus 5high (padrão)48.1$3.61$2.46$1.1646,200Não
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700Não
Claude Opus 5max50.8$5.86$4.05$1.8172,500Não
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200Não
Claude Opus 5.5medium (padrão)51.2$1.34$0.82$0.5125,700Sim
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600Sim
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700Sim
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200Sim
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600Não
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900Não
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100Não
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500Não
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100Não

Na fronteira significa que nenhuma outra configuração desta tabela pontua mais por menos dinheiro.

A fronteira de custo

Dez das 26 configurações estão na fronteira. Ordenadas por custo, são as únicas que valem a pena considerar só pelo preço. Todas as outras pagam mais pela mesma pontuação ou por uma menor.

ConfiguraçãoIntelligence IndexCusto por tarefaPor 10.000 tarefas
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

A fronteira tem duas regiões. De US$ 0,13 a US$ 1,06 é quase só GPT-6 Sol, com o GPT-6 Astra low como única exceção, a US$ 0,82. De US$ 1,34 para cima é só Opus 5.5. O salto entre as duas é pequeno: o Opus 5.5 medium pontua 3,7 pontos a mais que o Sol max por US$ 0,28 a mais por tarefa.

Frente a frente com pontuação igual ou melhor

Cada par compara uma configuração mais barata com uma mais cara que pontua igual ou menos.

Configuração mais barataConfiguração mais caraDiferença de pontuaçãoEconomia
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61+3.1 para Opus 5.563%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86+0.4 para Opus 5.577%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91empate66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26+0.9 para Opus 5.544%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63+0.2 para Opus 5.576%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61+0.6 para Opus 571%

A linha do Opus 5 importa para equipes que ainda não migraram. O Opus 5 rodava por padrão em esforço high. O Opus 5.5 roda por padrão em medium e, nesse padrão, pontua 3,1 pontos a mais por 63% menos por tarefa. A Anthropic diz que o Opus 5.5 é 40% mais barato que o Opus 5; a diferença medida neste índice é maior que a promessa.

Para onde vai o dinheiro: entrada, não saída

Em todos os modelos, a entrada fica entre metade e três quartos do custo por tarefa. No Opus 5.5 medium, US$ 0,82 dos US$ 1,34 são entrada, ou 61%. No GPT-6 Astra max são 58%, no GPT-6 Sol max 70% e no Fable 5.1 max 49%. Tarefas de agente reenviam o contexto crescente a cada passo, então o gasto com entrada cresce com o número de passos, não só com o tamanho da resposta.

É por isso que o GPT-6 Sol sem raciocínio custa mais que em low: US$ 0,33 contra US$ 0,13, embora escreva só 4.900 tokens de saída. US$ 0,28 dos US$ 0,33 são entrada. A causa provável são mais passos, cada um reenviando o contexto. Desligar o raciocínio não barateia um agente se ele depois precisa de mais turnos.

Para a sua fatura, isso significa que o cache importa tanto quanto a escolha do modelo. Opus 5.5 e GPT-6 Sol cobram US$ 0,20 por milhão de tokens de entrada em cache. O GPT-6 Astra cobra US$ 1,00 e o Opus 5 cobra US$ 0,50.

Volume de tokens contra preço de tabela

O GPT-6 Astra é o modelo mais econômico em tokens aqui. Em esforço max ele escreve 27.200 tokens de saída por tarefa, contra 119.200 do Opus 5.5 max. Mas o Astra cobra US$ 10 e US$ 50 por milhão, 2,5× a tarifa do Opus 5.5. O preço de tabela vence: o Opus 5.5 high custa US$ 1,82 por tarefa e pontua 53,6, enquanto o Astra max custa US$ 3,26 e pontua 52,7.

O Opus 5.5 max é o único ponto onde a verbosidade pesa. Seus 119.200 tokens de saída custam US$ 2,38 antes de qualquer entrada, e a tarefa inteira custa US$ 5,98. Isso compra a maior pontuação da tabela, 57,6, mas por 4,5× o custo do medium.

Retornos decrescentes por esforço

Cada linha mostra o que um nível a mais de esforço compra, em pontos de índice contra o custo extra por tarefa.

Modelomedium → highxhigh → max
GPT-6 Sol+3.0 pontos por +48%+3.4 pontos por +100%
GPT-6 Astra+1.3 pontos por +12%+0.3 pontos por +41%
Claude Opus 5+3.3 pontos por +65%+1.1 pontos por +20%
Claude Opus 5.5+2.4 pontos por +36%+1.6 pontos por +73%
Claude Fable 5.1+2.3 pontos por +31%+0.2 pontos por +28%

No Fable 5.1 e no GPT-6 Astra, o esforço max quase não compra nada: 0,2 e 0,3 ponto por 28% e 41% a mais. No Opus 5.5, subir para max ainda compra 1,6 ponto, mas custa 73% a mais. Use max só em tarefas onde você mediu que os pontos extras mudam o resultado.

Quando o GPT-6 Sol max basta

O índice é uma média, e a diferença entre o Sol max e o Opus 5.5 medium não é uniforme. Pontuações por avaliação da Artificial Analysis:

AvaliaçãoOpus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

Em AutomationBench e CritPt, o GPT-6 Sol empata ou supera o Opus 5.5 medium por US$ 1,06 por tarefa contra US$ 1,34. Em Terminal-Bench, nas avaliações de trabalho do conhecimento e no Humanity's Last Exam, o Opus 5.5 lidera com folga. Automação de fluxos de trabalho pode rodar no Sol. Agentes de terminal e de código e trabalho do conhecimento com muitos documentos são onde o Opus 5.5 justifica o preço.

Números do fornecedor contra números independentes

Números de fornecedor e números independentes costumam divergir, porque usam outros harnesses e outras configurações. A Anthropic informa 66,4% no Terminal-Bench 4.0 para o Opus 5.5 em xhigh. A Artificial Analysis mede 59,6% no mesmo esforço.

EsforçoOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

O ranking também muda com o índice. No Vals AI Index, o Fable 5.1 é o primeiro com 68,83%, o GPT-6 Astra o terceiro com 66,61% e o Opus 5.5 o quarto com 66,16%. Lá o custo por tarefa não é publicado na mesma base, então isso não mexe na fronteira acima. É um lembrete de que um índice é só uma visão.

Preços de tabela e uma tarefa com muito cache

A Digital Applied calculou o preço de uma tarefa de agente com muito cache em cada modelo: 8M tokens de leitura de cache, 400K de entrada sem cache, 600K de escrita em cache e 300K de saída. O resultado segue a fronteira, com uma penalidade extra para o GPT-6 Astra.

ModeloEntrada $/MTokSaída $/MTokLeitura de cache $/MTokTarefa com muito cache (Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

O GPT-6 Astra cobra a requisição inteira a US$ 20 e US$ 75 por milhão quando a entrada passa de 272K tokens. O Opus 5.5 mantém um único preço em toda a janela de 1M tokens. No Opus 5.5, escrever no cache custa US$ 5 por milhão no cache de 5 minutos e US$ 8 no de 1 hora, lotes são cobrados a 50% e o modo rápido dobra o preço. Para os detalhes, veja o Modelo de custos do Claude Opus 5.5 e a Economia do modo rápido do Opus 5.5.

Como medir o seu próprio custo por tarefa

  1. Registre tokens por tarefa, não por requisição: entrada sem cache, entrada em cache, escritas em cache e saída, somados em todos os passos da tarefa.
  2. Pegue uma amostra de algumas centenas de tarefas reais e rode de novo em duas ou três configurações candidatas, por exemplo Sol max, Opus 5.5 medium e Opus 5.5 high.
  3. Avalie cada resultado com a mesma verificação que você usa em produção e conte as tarefas aprovadas.
  4. Divida o gasto total pelas tarefas aprovadas. O custo por tarefa bem-sucedida é o número a comparar, porque uma configuração barata que falha mais não é barata.
  5. Escolha a configuração mais barata que atinge sua régua de qualidade e mande só as tarefas que falham para uma configuração mais alta.
  6. Refaça o teste quando um preço ou um esforço padrão mudar.

Para ver como o esforço muda a fatura de um mesmo modelo, veja Os níveis de esforço do Opus 5.5 são o preço real.

Ressalvas

Fontes

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research