Modelos Abertos vs. Fechados: Comparação de Custos LLM

Atualizado 15 de julho de 2026 · publicado pela primeira vez 4 de julho de 2026

Quando é rentável auto-hospedar Llama, Qwen ou DeepSeek em vez de pagar por acesso a API? Esta análise cobre custos de GPU, otimização de inferência, despesas operacionais e oferece uma estrutura de decisão para sua carga de trabalho específica.

8Modelos comparados
5Níveis de GPU analisados
3Cenários de equilíbrio
Jul 2026Última atualização

Metodologia

Preços de API

Tarifas padrão publicadas de cada página de preços do provedor. Sem descontos por volume ou lotes aplicados.

GPU em nuvem para auto-hospedagem

Preços sob demanda em nuvem (Lambda, RunPod, AWS) para configurações otimizadas para inferência com vLLM ou TensorRT-LLM.

Despesas operacionais

Inclui monitoramento, escalabilidade, atualizações de modelos e sobrecarga operacional de 15% nos custos brutos de GPU para infraestrutura gerenciada.

Brecha de qualidade

Relativa a GPT-4o / Claude Sonnet 4 como linha de base 100%. Baseada em benchmarks públicos e desempenho prático em tarefas.

Tabela de Comparação de Custos

Modelo Custo de API/mês Custo de Auto-hospedagem (GPU em nuvem) Volume de Equilíbrio Brecha de Qualidade
Llama 4 Maverick (DeepInfra) $260/mês $2.800/mês ~350M tokens/mês ~95% de GPT-4o
Llama 3.3 70B (Groq) $277/mês $1.200/mês ~210M tokens/mês ~87% de GPT-4o
Llama 4 Scout (Groq) $136/mês $1.400/mês ~350M tokens/mês ~88% de GPT-4o
Qwen 3.7-Max $525/mês $1.600/mês ~100M tokens/mês ~92% de GPT-4o
DeepSeek V4 Pro $435/mês $1.800/mês ~130M tokens/mês ~96% de GPT-4o
DeepSeek V4 Flash $140/mês $1.400/mês ~450M tokens/mês ~82% de GPT-4o
Mistral Medium 3.5 $525/mês $2.000/mês ~120M tokens/mês ~91% de GPT-4o
GPT-4o (somente API) $750/mês N/A N/A Linha de base (100%)

Custo de API/mês assume 100M tokens de saída + 300M tokens de entrada por mês a tarifas padrão.

Custo de Auto-hospedagem inclui aluguel de GPU, despesas operacionais de 15% e infraestrutura de inferência (vLLM). Não inclui tempo de engenharia inicial.

Volume de Equilíbrio é a contagem mensal de tokens de saída onde a auto-hospedagem se torna mais barata que a API.

Brecha de Qualidade é aproximada e depende da tarefa. Benchmarks como MMLU, HumanEval e GPQA informam essas estimativas.

Alguns links podem incluir códigos de referência.

Fatores-Chave de Custo

1) O aluguel de GPU é o custo dominante

Um nó 8x H100 para Llama 4 Maverick custa $2.000-$3.500/mês sob demanda de Lambda, RunPod ou AWS. Instâncias spot/preemptíveis podem reduzir isso 40-60% mas adicionam latência de reinicialização e risco de disponibilidade. Para cargas de trabalho de produção, instâncias reservadas (comprometimento de 1 ano) típicamente economizam 30-40% em relação ao sob demanda.

2) A otimização de inferência muda a equação

vLLM com batching contínuo, paging de KV-cache e quantização (GPTQ/AWQ 4-bit) podem aumentar a taxa de processamento 2-4x no mesmo hardware. TensorRT-LLM adiciona mais 20-40% para arquiteturas suportadas. Um Llama 4 Scout bem ajustado 4-bit em uma única A100 pode igualar uma configuração ingênua fp16 em 2x A100s.

3) A despesa operacional é real, mas está diminuindo

Executar infraestrutura de inferência requer monitoramento de GPU, atualizações de modelos, balanceamento de carga e failover. Planeje 15-25% do custo bruto de GPU para operações. As plataformas gerenciadas (Anyscale, Modal, Replicate) absorvem isso, mas cobram 30-50% de prêmio sobre GPU bruto - vale a pena por menos de ~$5K/mês em gasto com GPU.

4) O cache de prompt estreita a brecha para API

Os provedores de API oferecem cada vez mais cache de prompt (desconto de 50-90% em prefixos repetidos). Se sua carga de trabalho é amigável ao cache (RAG, multi-turn), os custos de API caem significativamente, empurrando o volume de equilíbrio mais alto para auto-hospedagem.

Estrutura de Decisão

Use API se...

  • O volume mensal de saída está abaixo de 100M tokens
  • Você precisa de qualidade de modelo de fronteira (GPT-4o, Claude Opus 4)
  • Sua equipe não tem expertise em GPU/MLOps
  • Os requisitos de latência são rigorosos (TTFT <200ms)
  • Você quer zero despesa operacional
  • Sua carga de trabalho é variável ou sazonal

Auto-hospede se...

  • O volume mensal de saída excede consistentemente 200M tokens
  • Privacidade de dados requer sem chamadas de API de terceiros
  • Você precisa de modelos personalizados fine-tuned
  • Você tem capacidade de MLOps na equipe
  • A carga de trabalho é estado estável (utilização de GPU previsível)
  • Você pode comprometer instâncias GPU reservadas de 1 ano

Abordagem híbrida: o meio-termo pragmático

A maioria das equipes acaba com um híbrido: use API para tarefas de raciocínio de fronteira e cargas baixas, auto-hospede modelos abertos para tarefas de alto volume e tolerantes a latência (geração de conteúdo, extração de dados, ferramentas internas). Isso mantém a despesa de API sob controle enquanto constrói capacidade de auto-hospedagem incrementalmente.

Onde Executar Modelos Abertos

Plataforma Opções de GPU Preço A100 80GB Preço H100 Inferência Gerenciada
Lambda Cloud A100, H100, H200 $1,10/hora $2,49/hora Não (traga o seu próprio)
RunPod A100, H100, L40S $1,19/hora $2,69/hora Opção sem servidor
AWS (p4d/p5) A100, H100 $3,67/hora $6,37/hora SageMaker
Google Cloud A100, H100 $3,22/hora $5,07/hora Vertex AI
Xiaomi MiMO ↗ Baseado em API N/A N/A API ($0,50/$2,00 por 1M)

Os preços de GPU são tarifas por hora sob demanda a partir de julho de 2026. Os preços reservados/spot variam significativamente.

MiMO oferece acesso baseado em API a MiMo-V2-Pro e MiMo-V2-Omni a tarifas competitivas - um meio-termo entre auto-hospedagem completa e preços de API premium.


Quer isso aplicado ao seu próprio gasto com LLM? FinOps LLM realiza uma auditoria gratuita de seus custos de IA e mostra onde estão as economias. Agendar auditoria gratuita →

Voltar para pesquisa