Rastreamento de Preços de API LLM
Atualizado em 15 de julho de 2026 · publicado pela primeira vez em 4 de julho de 2026
Rastreamento de preços por token em todos os principais provedores de LLM. Entrada, saída, leitura/gravação de cache, janelas de contexto e descontos em lotes em uma tabela normalizada. Atualizado mensalmente com dados verificáveis dos provedores.
- Todos os preços em USD por 1 milhão de tokens
- Valores estimados mostrados em cinza
- Os preços de cache refletem o cache de prompts onde está disponível
Metodologia
Coleta
Dados de preços coletados das páginas oficiais de preços e documentação de API dos provedores.
Normalização
Todos os preços normalizados em USD por 1 milhão de tokens para comparação direta.
Preços de cache
As colunas de Leitura/Gravação de cache mostram descontos de cache de prompts onde os provedores os suportam.
Política de visualização
Os valores oficiais e estimados estão claramente separados. As estimativas são marcadas em cinza.
Histórico de Atualizações
Rastreamento de Preços de API LLM lançado
Publicada a comparação de preços por token em mais de 12 principais provedores de LLM como artigo de pesquisa do FinOps LLM.
Tabela de Preços por Token
| Provedor ↕ | Modelo ↕ | Entrada $/1M ↕ | Saída $/1M ↕ | Leitura de Cache $/1M ↕ | Gravação de Cache $/1M ↕ | Janela de Contexto ↕ | Desconto em Lotes |
|---|---|---|---|---|---|---|---|
| OpenAI | GPT-5.6-Sol | $5.00 | $30.00 | $0.50 | $6.25 | 128K | 50% |
| OpenAI | GPT-5.6-Terra | $2.50 | $15.00 | $0.25 | $3.13 | 128K | 50% |
| OpenAI | GPT-5.6-Luna | $1.00 | $6.00 | $0.10 | $1.25 | 128K | 50% |
| OpenAI | GPT-5.5 | $5.00 | $30.00 | $0.50 | $6.25 | 128K | 50% |
| OpenAI | GPT-5.4 | $2.50 | $15.00 | $0.25 | $3.13 | 128K | 50% |
| OpenAI | o3 | $2.00 | $8.00 | $0.50 | $2.00 | 200K | 50% |
| OpenAI | o4-mini | $1.10 | $4.40 | $0.28 | $1.10 | 200K | 50% |
| Anthropic | Claude Fable 5 | $10.00 | $50.00 | $1.00 | $12.50 | 200K | 50% |
| Anthropic | Claude Opus 4.8 | $5.00 | $25.00 | $0.50 | $6.25 | 200K | 50% |
| Anthropic | Claude Sonnet 5* | $2.00 | $10.00 | $0.20 | $2.50 | 200K | 50% |
| Anthropic | Claude Haiku 4.5 | $1.00 | $5.00 | $0.10 | $1.25 | 200K | 50% |
| Gemini 3.5 Flash | $1.50 | $9.00 | $0.15 | $1.88 | 1M | 50% | |
| Gemini 3.1 Pro Preview | $2.00 | $12.00 | $0.20 | $2.50 | 1M | 50% | |
| Gemini 2.5 Pro | $1.25 | $5.00 | $0.31 | $4.50 | 1M | 50% | |
| Gemini 2.5 Flash | $0.15 | $0.60 | $0.04 | $0.15 | 1M | 50% | |
| xAI | Grok 4.5 | $2.00 | $6.00 | $0.50 | $1.50 | 1M | 50% |
| xAI | Grok 4.3 | $1.25 | $2.50 | - | - | 1M | 50% |
| Meta | Llama 4 Maverick (DeepInfra) | $0.20 | $0.80 | - | - | 1M | - |
| Meta | Llama 4 Scout (Groq) | $0.11 | $0.34 | - | - | 5M | - |
| Meta | Llama 3.3 70B (Groq) | $0.59 | $0.79 | - | - | 8M | - |
| Mistral | Mistral Large 2/3 | $2.00 | $6.00 | - | - | 128K | - |
| Mistral | Mistral Medium 3.5 | $1.50 | $7.50 | - | - | 128K | - |
| Mistral | Mistral Small 3 | $0.10 | $0.30 | - | - | 128K | - |
| Mistral | Codestral | $0.30 | $0.90 | - | - | 128K | - |
| DeepSeek | DeepSeek V4 Flash | $0.14 | $0.28 | $0.0028 | - | 128K | - |
| DeepSeek | DeepSeek V4 Pro | $0.435 | $0.87 | $0.0036 | - | 128K | - |
| Alibaba Qwen | Qwen 3.7-Max | $2.50 | $7.50 | - | - | 131K | - |
| Moonshot Kimi | Kimi K2.6 | $0.95 | $4.00 | $0.16 | - | 200K | - |
| Xiaomi MiMO Cadastre-se - ambos ganham $2 ↗ |
MiMo-V2-Pro | $0.50 | $2.00 | - | - | 128K | - |
| Xiaomi MiMO Cadastre-se - ambos ganham $2 ↗ |
MiMo-V2-Omni | $0.40 | $1.60 | - | - | 128K | - |
| Zhipu AI | GLM-5 | $1.00 | $4.00 | - | - | 128K | - |
| Zhipu AI | GLM-5-Turbo | $0.30 | $1.20 | - | - | 128K | - |
| MiniMax | M2.7 | $0.40 | $1.60 | - | - | 128K | - |
| StepFun | step-3.5-flash | $0.30 | $1.20 | - | - | 128K | - |
* Claude Sonnet 5: preços introdutórios de $2/$10 por 1M tokens em vigor até 31 de agosto de 2026; os preços padrão de $3/$15 começam em 1º de setembro de 2026.
Os valores não fornecidos explicitamente pelos provedores são mostrados em cinza.
Os preços do Meta Llama refletem preços de API hospedada (Fireworks, Together, etc.), não o custo de auto-hospedagem. A economia de auto-hospedagem é abordada em nossa Comparação de Custos de Código Aberto vs Código Fechado.
As janelas de contexto são as máximas suportadas; a disponibilidade real pode variar por nível.
Os preços de Leitura/Gravação de cache refletem o cache de prompts específico do provedor onde disponível. "-" significa que o provedor não oferece cache ou o preço não está publicado.
O Desconto em Lotes mostra a economia aproximada ao usar APIs de lote/assincromía onde disponível.
Alguns links podem incluir códigos de referência.
Os preços podem mudar com frequência. Sempre verifique as informações mais recentes nas páginas oficiais dos provedores.
Guia Prático
Como usar esses dados de preços para planejamento de custos
1) Calcule primeiro seu volume de tokens
Antes de comparar preços, estime seus volumes mensais de tokens de entrada e saída. Os tokens de saída são tipicamente 3-5x mais caros que os de entrada, então reduzir o comprimento da saída tem o maior impacto no custo.
2) Considere as economias de cache
Se sua carga de trabalho tem prompts de sistema ou contexto repetidos (RAG, conversas de múltiplos turnos), o cache de prompts pode reduzir os custos de entrada em 50-90%. Verifique a coluna de Leitura de Cache para os descontos aplicáveis.
3) Use APIs em lote para trabalhos não urgentes
A maioria dos principais provedores oferece descontos de 50% em chamadas de API em lote/assincromía. Se sua carga de trabalho tolera latência (avaliações, processamento de dados, geração de conteúdo), os preços em lote reduzem os custos pela metade.
4) Compare o custo total, não apenas o preço por token
Um modelo barato que precisa de 3x mais tokens para igualar a qualidade pode custar mais no total. Considere a qualidade do modelo e o desempenho específico da tarefa junto com os preços brutos.
Quer isso aplicado ao seu próprio gasto em LLM? FinOps LLM realiza uma auditoria gratuita de seus custos de IA e mostra onde estão as economias. Agende auditoria gratuita →