Guia de Preços de GPT-5.6: Luna, Terra, Sol
Publicado em 19 de julho de 2026
A OpenAI lançou o GPT-5.6 em 10 de julho com três níveis de preços distintos: Luna a $1/$6 por 1M de tokens, Terra a $2,50/$15 e Sol a $5/$30. Isso não é um simples tradeoff de velocidade/qualidade; cada nível é posicionado para uma classe diferente de carga de trabalho. A pergunta não é "qual é o melhor" — é "qual é o certo para esta tarefa?" Este guia mapeia tarefas para níveis, percorre exemplos de custo por tarefa e mostra como escalar inteligentemente quando um nível mais barato não é confiável o suficiente.
- Luna ($1/$6): classificação, extração simples, roteamento de alto volume
- Terra ($2,50/$15): raciocínio equilibrado, loops de agentes, conversas multi-turno
- Sol ($5/$30): raciocínio de fronteira, geração de código, pesquisa difícil
- Leituras de cache economizam 90%; gravações de cache custam 1,25× entrada — ponto de equilíbrio em 5+ acertos em 30 min
- A API de lote adiciona 50% de desconto além dos preços de nível para trabalho não interativo
1. Os Três Níveis: Velocidade, Custo e Capacidade
| Nível | Entrada $/1M | Saída $/1M | Leitura de Cache $/1M | Contexto | Latência Típica |
|---|---|---|---|---|---|
| Luna | $1,00 | $6,00 | $0,10 | 128K | 80–200 ms |
| Terra | $2,50 | $15,00 | $0,25 | 128K | 150–400 ms |
| Sol | $5,00 | $30,00 | $0,50 | 128K | 300–800 ms |
A latência importa: Luna é mais rápido porque é otimizado para streaming, classificação em tempo real e rendimento. Sol é mais lento porque realiza mais raciocínio interno. Para cargas de trabalho interativas voltadas para o usuário, Luna também é mais barato e mais rápido — mas apenas se for capaz o suficiente para sua tarefa. Essa é a decisão-chave de roteamento.
2. Tabela de Roteamento por Tipo de Tarefa
Esta tabela mapeia tarefas comuns de LLM para o nível que minimiza o custo por resposta bem-sucedida:
| Tipo de Tarefa | Exemplo | Nível Recomendado | Taxa de Sucesso no Nível | Custo Est./1K Tarefas |
|---|---|---|---|---|
| Classificação | Spam / não-spam; sentimento (pos/neg/neutro) | Luna | 95–98% | $1,20–$1,50 |
| Extração estruturada | Extrair nome, email, telefone do texto | Luna | 92–96% | $1,80–$2,40 |
| Categorização (muitas classes) | Atribuir uma de 50+ categorias de produto | Luna | 88–94% | $2,40–$3,20 |
| Resumo | Condensar artigo ou log de chat | Luna | 92–97% | $1,50–$2,00 |
| Loops de agentes (uso de ferramentas) | Multi-turno: pesquisar, raciocinar, refinar | Terra | 85–92% | $8,00–$12,00 |
| Conversa multi-turno | Bots de suporte ao cliente, consultoria | Terra | 88–94% | $6,00–$10,00 |
| Geração de código (simples) | Consulta SQL, snippet Bash, regex | Terra | 80–90% | $10,00–$15,00 |
| Geração de código (complexa) | Endpoint completo, máquina de estados, compilador DSL | Sol | 75–88% | $25,00–$40,00 |
| Pesquisa + síntese | Analisar 10+ artigos, sintetizar consenso | Sol | 80–90% | $30,00–$50,00 |
| Raciocínio difícil (problema novel) | Verificação de prova, design de algoritmo novel | Sol | 70–85% | $40,00–$70,00 |
Insight-chave: O custo por tarefa não é apenas custo de API — é (custo de API) / (taxa de sucesso). Uma classificação Luna com 95% de sucesso custa ~$1,26 por resposta bem-sucedida. Se você rotear a mesma tarefa para Sol com 98% de sucesso, paga ~$5,10 por resposta — mas resolveu 3% mais de sua carga de trabalho, o que pode ou não valer o custo 4×.
3. Exemplos Resolvidos de Custo Por Tarefa
Exemplo 1: Classificação de Spam (Luna)
Tarefa: Classificar email como spam (sim/não binário).
Perfil de tokens típico: 400 entrada (email) + 50 saída (classificação + confiança) = 450 tokens.
Custo Luna: (400 × $1/1M) + (50 × $6/1M) = $0,00043/solicitação.
Se 96% têm sucesso na primeira tentativa: $0,00043 / 0,96 = $0,00045 por classificação bem-sucedida.
A 1M de emails/mês: $450/mês (mais desconto de cache se você reutilizar prompts do sistema).
Se roteado incorretamente para Sol: (400 × $5 + 50 × $30) / 1M = $0,0025 por solicitação. Com 98% de sucesso: $0,00255/bem-sucedida = $2.550/mês (5,7× mais).
Exemplo 2: Agente de Suporte ao Cliente (Terra)
Tarefa: Conversa de suporte multi-turno com uso de ferramentas (busca de tickets, busca de políticas, decisão de escalação).
Perfil de tokens típico por turno: 2.000 entrada (contexto + histórico) + 400 saída (resposta + chamadas de ferramentas) = 2.400 tokens. Média de 3 turnos para resolver = 7.200 tokens totais por ticket.
Custo Terra: (2.000 × $2,50/1M) + (400 × $15/1M) = $0,0080/turno ou $0,0240 por ticket.
Se 90% são resolvidos sem escalação: $0,0240 / 0,90 = $0,0267 por ticket bem-sucedido.
A 10K tickets/mês: $267/mês.
Se usava Luna em seu lugar: (2.000 × $1 + 400 × $6) / 1M = $0,0044 por turno = $0,0132/ticket. Mas o sucesso do loop de agentes de Luna cai para 65% (chamadas de ferramentas falham, o raciocínio é raso). Custo por bem-sucedida: $0,0132 / 0,65 = $0,0203. Economia líquida: $29/mês, mas 25% dos tickets falham e escalam, elevando o custo de suporte em $400+. Luna não funciona aqui.
Exemplo 3: Geração de Código (Terra vs Sol)
Tarefa: Gerar função Python a partir de string de requisito.
Perfil de tokens típico: 1.500 entrada (especificação + exemplos) + 600 saída (código + explicação) = 2.100 tokens.
Custo Terra: (1.500 × $2,50 + 600 × $15) / 1M = $0,0134 por solicitação. Com 85% de sucesso na primeira passagem (código compila + passa testes básicos): $0,0158 por função que funciona.
Custo Sol: (1.500 × $5 + 600 × $30) / 1M = $0,0255 por solicitação. Com 90% de sucesso na primeira passagem: $0,0283 por função que funciona.
Economia com Terra: 44% mais barato por resultado que funciona. Use Sol apenas se a diferença de 5% na taxa de sucesso e qualidade de código reduzir mensuravelmente o custo de debugging descendente.
4. Padrão de Roteamento em Cascata & Fallback
A maioria das equipes de FinOps não deveria usar um único nível para todo trabalho. Em vez disso, implemente um padrão em cascata: comece com o nível mais barato, meça confiança, escale em baixa confiança.
| Passo | Modelo | Limite de Confiança | Ação se Limite Não for Atendido |
|---|---|---|---|
| 1 | Luna | Confiança > 85% | Retornar resultado |
| 2 | Terra | Confiança > 75% | Retornar resultado (escalado) |
| 3 | Sol | Confiança > 60% | Retornar resultado ou falhar explicitamente |
| 4 | Revisão humana | — | Escalar para humano |
Cenário real: Você está fazendo classificação de documentos para faturas (classificar por fornecedor). Luna retornará resultados de alta confiança (~94% de sucesso) e custará ~$1,20 por 1K. Para os 6% de faturas ambíguas onde Luna retorna confiança < 85%, escale para Terra (~94% de sucesso para casos difíceis), custando ~$3,75 por 1K de escalações. Se 6% de 10K documentos escalam: 600 × $3,75 = $2,25 extras, total $12 + $2,25 = $14,25/10K. Terra puro custaria ~$37,50. Cascata economiza 62% enquanto melhora a precisão em casos limites.
5. Economia de Cache de Prompts
GPT-5.6 mudou os custos de cache: gravações de cache agora custam 1,25× a taxa de entrada sem cache (não gratuito), e leituras de cache custam 10% de entrada.
| Cenário | Tamanho de Prefixo | Custo de Gravação | Custo de Leitura (por acerto) | Acertos de Ponto de Equilíbrio | Economia @ 10 acertos/mês |
|---|---|---|---|---|---|
| Contexto de recuperação em cache Luna | 100K tokens | $0,125 | $0,010 | 15 acertos | -$0,025 (perda) |
| Prompt do sistema em cache Luna + docs | 50K tokens | $0,063 | $0,005 | 8 acertos | $0,032 |
| Contexto de agentes em cache Terra | 80K tokens | $0,250 | $0,020 | 14 acertos | $0,030 |
| Contexto de raciocínio em cache Sol | 100K tokens | $0,625 | $0,050 | 13 acertos | $0,025 |
Quando cachear: Se seu prompt inclui um prefixo estável (instruções do sistema, documentação, exemplos com poucos disparos) que é reutilizado mais de 5–10 vezes em uma janela de 30 minutos, o cache geralmente economiza dinheiro. A API de lote (50% de desconto) agora compete com cache em custo — se você classifica documentos em lote, o desconto de lote vence a sobrecarga de cache.
6. Comparação com Claude Sonnet 5, Gemini 3.1 Pro e DeepSeek V4
| Modelo | Entrada $/1M | Saída $/1M | Velocidade | Capacidade de Raciocínio | Quando Escolher |
|---|---|---|---|---|---|
| GPT-5.6 Luna | $1,00 | $6,00 | Rápido | Seguimento de instruções, roteamento | Classificação, extração, rendimento |
| GPT-5.6 Terra | $2,50 | $15,00 | Médio | Raciocínio moderado, uso de ferramentas | Agentes, multi-turno, código médio |
| GPT-5.6 Sol | $5,00 | $30,00 | Lento | Raciocínio de fronteira, pesquisa | Código complexo, raciocínio difícil, problemas novel |
| Claude Sonnet 5 | $2,00–$3,00 | $10,00–$15,00 | Médio–Rápido | Raciocínio forte, tokens de raciocínio longo | Raciocínio, codificação (competitivo com Sol) |
| Gemini 3.1 Pro | $2,00 | $12,00 | Médio | Multimodal, capacidade de pesquisa | Tarefas multimodais, competitivo com Terra |
| DeepSeek V4 Flash | $0,14 | $0,28 | Muito Rápido | Raciocínio básico, foco em entrada em cache | Roteamento de alto volume, cargas de trabalho com foco em cache (7–35× mais barato) |
Arbitragem de custos: Para classificação simples e extração, DeepSeek V4 Flash é 7–20× mais barato que Luna. Compare com seus dados — se atinge 90%+ de precisão, use-o e guarde a diferença. Claude Sonnet 5 é 2× mais caro que Terra, mas fornece raciocínio mais forte por pretensão de capacidade de modelo; use-o se seu benchmark de Terra mostrar qualidade insuficiente. Gemini 3.1 Pro fica entre Luna e Terra — útil se você precisa de entrada multimodal ou já está no ecossistema Vertex AI.
7. Migração de GPT-5/5.5 & Status de Deprecação
A OpenAI continua oferecendo GPT-5.5 ($5/$30, igual ao Sol) e GPT-5.4 ($2,50/$15, igual ao Terra) junto com GPT-5.6. Não há pressão de deprecação em modelos mais antigos — você pode continuar usando GPT-5.5 se seu código o alvo. No entanto, GPT-5.6 pretende paridade de desempenho (ou melhor) no mesmo nível, portanto migre para 5.6 para novas implantações.
A interface ChatGPT continua aposentando modelos mais antigos continuamente (GPT-4o mini, GPT-4 turbo agora são apenas leitura); o acesso pela API é estável. Se você constrói contra a API, planeje revisões anuais do status de deprecação de modelo, mas não espere urgência.
Estrutura de Medição de Custos
Passo 1: Estabelecer linha de base por nível
Execute uma semana de tráfego e registre qual nível lidou com cada solicitação. Isso fornece distribuição de linha de base e custo.
Passo 2: Medir pontuações de confiança e taxas de fallback
Para cada nível, registre confiança retornada. Calcule: qual % de chamadas Luna têm confiança > 85%? Qual % escala para Terra? Isso diz se sua cascata está equilibrada.
Passo 3: Auditar sucesso/fracasso por nível
Compare saída do modelo contra verdade fundamental por uma semana. Qual nível tem desempenho insuficiente em seus dados? Ajuste limites ou seleção de nível com base em precisão real, não em pretensões da OpenAI.
Passo 4: Calcular custo verdadeiro por resposta bem-sucedida
Custo verdadeiro = (custo_nível) / (taxa_sucesso). Se Luna custa $1,20 por 1K com 94% de sucesso, o custo por resposta que funciona é $1,28. Essa é a métrica a otimizar.
Lista de Verificação Rápida de Seleção de Nível
- Esta é uma tarefa de classificação, extração ou roteamento? → Luna a menos que a precisão seja crítica.
- A tarefa envolve uso de ferramentas ou raciocínio multi-turno? → Terra.
- Isso é raciocínio novel, código complexo ou análise multi-hop? → Sol (ou compare Claude Sonnet 5 primeiro).
- Você pode implementar uma cascata (Luna → Terra → Sol)? → Sim, isso geralmente é ideal.
- Há um prefixo estável (prompt do sistema, docs) reutilizado 10+ vezes/mês? → Cachear, medir ROI no ponto de equilíbrio (5–15 acertos).
- Isso é lote ou interativo? → Trabalho em lote se qualifica para 50% de desconto; recalcule ROI com API de lote.
- Você comparou alternativas (Claude, DeepSeek, Gemini)? → Faça no seu dados, não em pretensões de marketing.
A seleção de nível é um problema de classificação: combine propriedades de carga de trabalho com economia de nível. O ideal é roteamento em cascata — rotei para Luna primeiro, meça confiança, escale na incerteza. Isso minimiza custo mantendo qualidade. A FinOps LLM pode executar uma auditoria de custos em seu tráfego de LLM e mostrar onde o desajuste de nível está deixando dinheiro na mesa. Agende uma auditoria gratuita.
Veja também: Quanto Custa GPT-5? para o panorama completo de preços de GPT e Custos Ocultos de LLM para infraestrutura e gastos indiretos de fallback além de taxas por token.