Rastreamento de Preços de API LLM

Atualizado em 15 de julho de 2026 · publicado pela primeira vez em 4 de julho de 2026

Rastreamento de preços por token em todos os principais provedores de LLM. Entrada, saída, leitura/gravação de cache, janelas de contexto e descontos em lotes em uma tabela normalizada. Atualizado mensalmente com dados verificáveis dos provedores.

12+Provedores rastreados
25+Modelos listados
6Colunas de preço
Jul 2026Última atualização

Metodologia

Coleta

Dados de preços coletados das páginas oficiais de preços e documentação de API dos provedores.

Normalização

Todos os preços normalizados em USD por 1 milhão de tokens para comparação direta.

Preços de cache

As colunas de Leitura/Gravação de cache mostram descontos de cache de prompts onde os provedores os suportam.

Política de visualização

Os valores oficiais e estimados estão claramente separados. As estimativas são marcadas em cinza.

Histórico de Atualizações

4 jul 2026

Rastreamento de Preços de API LLM lançado

Publicada a comparação de preços por token em mais de 12 principais provedores de LLM como artigo de pesquisa do FinOps LLM.

Tabela de Preços por Token

Provedor Modelo Entrada $/1M Saída $/1M Leitura de Cache $/1M Gravação de Cache $/1M Janela de Contexto Desconto em Lotes
OpenAI GPT-5.6-Sol $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.6-Terra $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI GPT-5.6-Luna $1.00 $6.00 $0.10 $1.25 128K 50%
OpenAI GPT-5.5 $5.00 $30.00 $0.50 $6.25 128K 50%
OpenAI GPT-5.4 $2.50 $15.00 $0.25 $3.13 128K 50%
OpenAI o3 $2.00 $8.00 $0.50 $2.00 200K 50%
OpenAI o4-mini $1.10 $4.40 $0.28 $1.10 200K 50%
Anthropic Claude Fable 5 $10.00 $50.00 $1.00 $12.50 200K 50%
Anthropic Claude Opus 4.8 $5.00 $25.00 $0.50 $6.25 200K 50%
Anthropic Claude Sonnet 5* $2.00 $10.00 $0.20 $2.50 200K 50%
Anthropic Claude Haiku 4.5 $1.00 $5.00 $0.10 $1.25 200K 50%
Google Gemini 3.5 Flash $1.50 $9.00 $0.15 $1.88 1M 50%
Google Gemini 3.1 Pro Preview $2.00 $12.00 $0.20 $2.50 1M 50%
Google Gemini 2.5 Pro $1.25 $5.00 $0.31 $4.50 1M 50%
Google Gemini 2.5 Flash $0.15 $0.60 $0.04 $0.15 1M 50%
xAI Grok 4.5 $2.00 $6.00 $0.50 $1.50 1M 50%
xAI Grok 4.3 $1.25 $2.50 - - 1M 50%
Meta Llama 4 Maverick (DeepInfra) $0.20 $0.80 - - 1M -
Meta Llama 4 Scout (Groq) $0.11 $0.34 - - 5M -
Meta Llama 3.3 70B (Groq) $0.59 $0.79 - - 8M -
Mistral Mistral Large 2/3 $2.00 $6.00 - - 128K -
Mistral Mistral Medium 3.5 $1.50 $7.50 - - 128K -
Mistral Mistral Small 3 $0.10 $0.30 - - 128K -
Mistral Codestral $0.30 $0.90 - - 128K -
DeepSeek DeepSeek V4 Flash $0.14 $0.28 $0.0028 - 128K -
DeepSeek DeepSeek V4 Pro $0.435 $0.87 $0.0036 - 128K -
Alibaba Qwen Qwen 3.7-Max $2.50 $7.50 - - 131K -
Moonshot Kimi Kimi K2.6 $0.95 $4.00 $0.16 - 200K -
Xiaomi MiMO
Cadastre-se - ambos ganham $2 ↗
MiMo-V2-Pro $0.50 $2.00 - - 128K -
Xiaomi MiMO
Cadastre-se - ambos ganham $2 ↗
MiMo-V2-Omni $0.40 $1.60 - - 128K -
Zhipu AI GLM-5 $1.00 $4.00 - - 128K -
Zhipu AI GLM-5-Turbo $0.30 $1.20 - - 128K -
MiniMax M2.7 $0.40 $1.60 - - 128K -
StepFun step-3.5-flash $0.30 $1.20 - - 128K -

* Claude Sonnet 5: preços introdutórios de $2/$10 por 1M tokens em vigor até 31 de agosto de 2026; os preços padrão de $3/$15 começam em 1º de setembro de 2026.

Os valores não fornecidos explicitamente pelos provedores são mostrados em cinza.

Os preços do Meta Llama refletem preços de API hospedada (Fireworks, Together, etc.), não o custo de auto-hospedagem. A economia de auto-hospedagem é abordada em nossa Comparação de Custos de Código Aberto vs Código Fechado.

As janelas de contexto são as máximas suportadas; a disponibilidade real pode variar por nível.

Os preços de Leitura/Gravação de cache refletem o cache de prompts específico do provedor onde disponível. "-" significa que o provedor não oferece cache ou o preço não está publicado.

O Desconto em Lotes mostra a economia aproximada ao usar APIs de lote/assincromía onde disponível.

Alguns links podem incluir códigos de referência.

Os preços podem mudar com frequência. Sempre verifique as informações mais recentes nas páginas oficiais dos provedores.

Guia Prático

Como usar esses dados de preços para planejamento de custos

1) Calcule primeiro seu volume de tokens

Antes de comparar preços, estime seus volumes mensais de tokens de entrada e saída. Os tokens de saída são tipicamente 3-5x mais caros que os de entrada, então reduzir o comprimento da saída tem o maior impacto no custo.

2) Considere as economias de cache

Se sua carga de trabalho tem prompts de sistema ou contexto repetidos (RAG, conversas de múltiplos turnos), o cache de prompts pode reduzir os custos de entrada em 50-90%. Verifique a coluna de Leitura de Cache para os descontos aplicáveis.

3) Use APIs em lote para trabalhos não urgentes

A maioria dos principais provedores oferece descontos de 50% em chamadas de API em lote/assincromía. Se sua carga de trabalho tolera latência (avaliações, processamento de dados, geração de conteúdo), os preços em lote reduzem os custos pela metade.

4) Compare o custo total, não apenas o preço por token

Um modelo barato que precisa de 3x mais tokens para igualar a qualidade pode custar mais no total. Considere a qualidade do modelo e o desempenho específico da tarefa junto com os preços brutos.


Quer isso aplicado ao seu próprio gasto em LLM? FinOps LLM realiza uma auditoria gratuita de seus custos de IA e mostra onde estão as economias. Agende auditoria gratuita →

Voltar à pesquisa