Modelos Abertos vs. Fechados: Comparação de Custos LLM
Atualizado 15 de julho de 2026 · publicado pela primeira vez 4 de julho de 2026
Quando é rentável auto-hospedar Llama, Qwen ou DeepSeek em vez de pagar por acesso a API? Esta análise cobre custos de GPU, otimização de inferência, despesas operacionais e oferece uma estrutura de decisão para sua carga de trabalho específica.
- Os custos de auto-hospedagem assumem preços de GPU em nuvem (sob demanda)
- Os custos de API usam preços padrão de saída por provedor
- O equilíbrio é baseado em utilização de 70%, disponibilidade 24/7
Metodologia
Preços de API
Tarifas padrão publicadas de cada página de preços do provedor. Sem descontos por volume ou lotes aplicados.
GPU em nuvem para auto-hospedagem
Preços sob demanda em nuvem (Lambda, RunPod, AWS) para configurações otimizadas para inferência com vLLM ou TensorRT-LLM.
Despesas operacionais
Inclui monitoramento, escalabilidade, atualizações de modelos e sobrecarga operacional de 15% nos custos brutos de GPU para infraestrutura gerenciada.
Brecha de qualidade
Relativa a GPT-4o / Claude Sonnet 4 como linha de base 100%. Baseada em benchmarks públicos e desempenho prático em tarefas.
Tabela de Comparação de Custos
| Modelo ↕ | Custo de API/mês ↕ | Custo de Auto-hospedagem (GPU em nuvem) ↕ | Volume de Equilíbrio ↕ | Brecha de Qualidade |
|---|---|---|---|---|
| Llama 4 Maverick (DeepInfra) | $260/mês | $2.800/mês | ~350M tokens/mês | ~95% de GPT-4o |
| Llama 3.3 70B (Groq) | $277/mês | $1.200/mês | ~210M tokens/mês | ~87% de GPT-4o |
| Llama 4 Scout (Groq) | $136/mês | $1.400/mês | ~350M tokens/mês | ~88% de GPT-4o |
| Qwen 3.7-Max | $525/mês | $1.600/mês | ~100M tokens/mês | ~92% de GPT-4o |
| DeepSeek V4 Pro | $435/mês | $1.800/mês | ~130M tokens/mês | ~96% de GPT-4o |
| DeepSeek V4 Flash | $140/mês | $1.400/mês | ~450M tokens/mês | ~82% de GPT-4o |
| Mistral Medium 3.5 | $525/mês | $2.000/mês | ~120M tokens/mês | ~91% de GPT-4o |
| GPT-4o (somente API) | $750/mês | N/A | N/A | Linha de base (100%) |
Custo de API/mês assume 100M tokens de saída + 300M tokens de entrada por mês a tarifas padrão.
Custo de Auto-hospedagem inclui aluguel de GPU, despesas operacionais de 15% e infraestrutura de inferência (vLLM). Não inclui tempo de engenharia inicial.
Volume de Equilíbrio é a contagem mensal de tokens de saída onde a auto-hospedagem se torna mais barata que a API.
Brecha de Qualidade é aproximada e depende da tarefa. Benchmarks como MMLU, HumanEval e GPQA informam essas estimativas.
Alguns links podem incluir códigos de referência.
Fatores-Chave de Custo
1) O aluguel de GPU é o custo dominante
Um nó 8x H100 para Llama 4 Maverick custa $2.000-$3.500/mês sob demanda de Lambda, RunPod ou AWS. Instâncias spot/preemptíveis podem reduzir isso 40-60% mas adicionam latência de reinicialização e risco de disponibilidade. Para cargas de trabalho de produção, instâncias reservadas (comprometimento de 1 ano) típicamente economizam 30-40% em relação ao sob demanda.
2) A otimização de inferência muda a equação
vLLM com batching contínuo, paging de KV-cache e quantização (GPTQ/AWQ 4-bit) podem aumentar a taxa de processamento 2-4x no mesmo hardware. TensorRT-LLM adiciona mais 20-40% para arquiteturas suportadas. Um Llama 4 Scout bem ajustado 4-bit em uma única A100 pode igualar uma configuração ingênua fp16 em 2x A100s.
3) A despesa operacional é real, mas está diminuindo
Executar infraestrutura de inferência requer monitoramento de GPU, atualizações de modelos, balanceamento de carga e failover. Planeje 15-25% do custo bruto de GPU para operações. As plataformas gerenciadas (Anyscale, Modal, Replicate) absorvem isso, mas cobram 30-50% de prêmio sobre GPU bruto - vale a pena por menos de ~$5K/mês em gasto com GPU.
4) O cache de prompt estreita a brecha para API
Os provedores de API oferecem cada vez mais cache de prompt (desconto de 50-90% em prefixos repetidos). Se sua carga de trabalho é amigável ao cache (RAG, multi-turn), os custos de API caem significativamente, empurrando o volume de equilíbrio mais alto para auto-hospedagem.
Estrutura de Decisão
Use API se...
- O volume mensal de saída está abaixo de 100M tokens
- Você precisa de qualidade de modelo de fronteira (GPT-4o, Claude Opus 4)
- Sua equipe não tem expertise em GPU/MLOps
- Os requisitos de latência são rigorosos (TTFT <200ms)
- Você quer zero despesa operacional
- Sua carga de trabalho é variável ou sazonal
Auto-hospede se...
- O volume mensal de saída excede consistentemente 200M tokens
- Privacidade de dados requer sem chamadas de API de terceiros
- Você precisa de modelos personalizados fine-tuned
- Você tem capacidade de MLOps na equipe
- A carga de trabalho é estado estável (utilização de GPU previsível)
- Você pode comprometer instâncias GPU reservadas de 1 ano
Abordagem híbrida: o meio-termo pragmático
A maioria das equipes acaba com um híbrido: use API para tarefas de raciocínio de fronteira e cargas baixas, auto-hospede modelos abertos para tarefas de alto volume e tolerantes a latência (geração de conteúdo, extração de dados, ferramentas internas). Isso mantém a despesa de API sob controle enquanto constrói capacidade de auto-hospedagem incrementalmente.
Onde Executar Modelos Abertos
| Plataforma | Opções de GPU | Preço A100 80GB | Preço H100 | Inferência Gerenciada |
|---|---|---|---|---|
| Lambda Cloud | A100, H100, H200 | $1,10/hora | $2,49/hora | Não (traga o seu próprio) |
| RunPod | A100, H100, L40S | $1,19/hora | $2,69/hora | Opção sem servidor |
| AWS (p4d/p5) | A100, H100 | $3,67/hora | $6,37/hora | SageMaker |
| Google Cloud | A100, H100 | $3,22/hora | $5,07/hora | Vertex AI |
| Xiaomi MiMO ↗ | Baseado em API | N/A | N/A | API ($0,50/$2,00 por 1M) |
Os preços de GPU são tarifas por hora sob demanda a partir de julho de 2026. Os preços reservados/spot variam significativamente.
MiMO oferece acesso baseado em API a MiMo-V2-Pro e MiMo-V2-Omni a tarifas competitivas - um meio-termo entre auto-hospedagem completa e preços de API premium.
Quer isso aplicado ao seu próprio gasto com LLM? FinOps LLM realiza uma auditoria gratuita de seus custos de IA e mostra onde estão as economias. Agendar auditoria gratuita →