Guia de Preços de GPT-5.6: Luna, Terra, Sol

Publicado em 19 de julho de 2026

A OpenAI lançou o GPT-5.6 em 10 de julho com três níveis de preços distintos: Luna a $1/$6 por 1M de tokens, Terra a $2,50/$15 e Sol a $5/$30. Isso não é um simples tradeoff de velocidade/qualidade; cada nível é posicionado para uma classe diferente de carga de trabalho. A pergunta não é "qual é o melhor" — é "qual é o certo para esta tarefa?" Este guia mapeia tarefas para níveis, percorre exemplos de custo por tarefa e mostra como escalar inteligentemente quando um nível mais barato não é confiável o suficiente.

Ressalva crítica: A OpenAI posiciona Terra e Sol como tendo capacidade de raciocínio equivalente, diferenciando-se principalmente em velocidade e rendimento. Compare ambos contra sua carga de trabalho real — a pretensão de paridade nem sempre se mantém em sua distribuição de dados. Veja GPT-5 vs alternativas para comparação com Claude e DeepSeek.

1. Os Três Níveis: Velocidade, Custo e Capacidade

Nível Entrada $/1M Saída $/1M Leitura de Cache $/1M Contexto Latência Típica
Luna $1,00 $6,00 $0,10 128K 80–200 ms
Terra $2,50 $15,00 $0,25 128K 150–400 ms
Sol $5,00 $30,00 $0,50 128K 300–800 ms

A latência importa: Luna é mais rápido porque é otimizado para streaming, classificação em tempo real e rendimento. Sol é mais lento porque realiza mais raciocínio interno. Para cargas de trabalho interativas voltadas para o usuário, Luna também é mais barato e mais rápido — mas apenas se for capaz o suficiente para sua tarefa. Essa é a decisão-chave de roteamento.

2. Tabela de Roteamento por Tipo de Tarefa

Esta tabela mapeia tarefas comuns de LLM para o nível que minimiza o custo por resposta bem-sucedida:

Tipo de Tarefa Exemplo Nível Recomendado Taxa de Sucesso no Nível Custo Est./1K Tarefas
Classificação Spam / não-spam; sentimento (pos/neg/neutro) Luna 95–98% $1,20–$1,50
Extração estruturada Extrair nome, email, telefone do texto Luna 92–96% $1,80–$2,40
Categorização (muitas classes) Atribuir uma de 50+ categorias de produto Luna 88–94% $2,40–$3,20
Resumo Condensar artigo ou log de chat Luna 92–97% $1,50–$2,00
Loops de agentes (uso de ferramentas) Multi-turno: pesquisar, raciocinar, refinar Terra 85–92% $8,00–$12,00
Conversa multi-turno Bots de suporte ao cliente, consultoria Terra 88–94% $6,00–$10,00
Geração de código (simples) Consulta SQL, snippet Bash, regex Terra 80–90% $10,00–$15,00
Geração de código (complexa) Endpoint completo, máquina de estados, compilador DSL Sol 75–88% $25,00–$40,00
Pesquisa + síntese Analisar 10+ artigos, sintetizar consenso Sol 80–90% $30,00–$50,00
Raciocínio difícil (problema novel) Verificação de prova, design de algoritmo novel Sol 70–85% $40,00–$70,00

Insight-chave: O custo por tarefa não é apenas custo de API — é (custo de API) / (taxa de sucesso). Uma classificação Luna com 95% de sucesso custa ~$1,26 por resposta bem-sucedida. Se você rotear a mesma tarefa para Sol com 98% de sucesso, paga ~$5,10 por resposta — mas resolveu 3% mais de sua carga de trabalho, o que pode ou não valer o custo 4×.

3. Exemplos Resolvidos de Custo Por Tarefa

Exemplo 1: Classificação de Spam (Luna)

Tarefa: Classificar email como spam (sim/não binário).

Perfil de tokens típico: 400 entrada (email) + 50 saída (classificação + confiança) = 450 tokens.

Custo Luna: (400 × $1/1M) + (50 × $6/1M) = $0,00043/solicitação.

Se 96% têm sucesso na primeira tentativa: $0,00043 / 0,96 = $0,00045 por classificação bem-sucedida.

A 1M de emails/mês: $450/mês (mais desconto de cache se você reutilizar prompts do sistema).

Se roteado incorretamente para Sol: (400 × $5 + 50 × $30) / 1M = $0,0025 por solicitação. Com 98% de sucesso: $0,00255/bem-sucedida = $2.550/mês (5,7× mais).

Exemplo 2: Agente de Suporte ao Cliente (Terra)

Tarefa: Conversa de suporte multi-turno com uso de ferramentas (busca de tickets, busca de políticas, decisão de escalação).

Perfil de tokens típico por turno: 2.000 entrada (contexto + histórico) + 400 saída (resposta + chamadas de ferramentas) = 2.400 tokens. Média de 3 turnos para resolver = 7.200 tokens totais por ticket.

Custo Terra: (2.000 × $2,50/1M) + (400 × $15/1M) = $0,0080/turno ou $0,0240 por ticket.

Se 90% são resolvidos sem escalação: $0,0240 / 0,90 = $0,0267 por ticket bem-sucedido.

A 10K tickets/mês: $267/mês.

Se usava Luna em seu lugar: (2.000 × $1 + 400 × $6) / 1M = $0,0044 por turno = $0,0132/ticket. Mas o sucesso do loop de agentes de Luna cai para 65% (chamadas de ferramentas falham, o raciocínio é raso). Custo por bem-sucedida: $0,0132 / 0,65 = $0,0203. Economia líquida: $29/mês, mas 25% dos tickets falham e escalam, elevando o custo de suporte em $400+. Luna não funciona aqui.

Exemplo 3: Geração de Código (Terra vs Sol)

Tarefa: Gerar função Python a partir de string de requisito.

Perfil de tokens típico: 1.500 entrada (especificação + exemplos) + 600 saída (código + explicação) = 2.100 tokens.

Custo Terra: (1.500 × $2,50 + 600 × $15) / 1M = $0,0134 por solicitação. Com 85% de sucesso na primeira passagem (código compila + passa testes básicos): $0,0158 por função que funciona.

Custo Sol: (1.500 × $5 + 600 × $30) / 1M = $0,0255 por solicitação. Com 90% de sucesso na primeira passagem: $0,0283 por função que funciona.

Economia com Terra: 44% mais barato por resultado que funciona. Use Sol apenas se a diferença de 5% na taxa de sucesso e qualidade de código reduzir mensuravelmente o custo de debugging descendente.

4. Padrão de Roteamento em Cascata & Fallback

A maioria das equipes de FinOps não deveria usar um único nível para todo trabalho. Em vez disso, implemente um padrão em cascata: comece com o nível mais barato, meça confiança, escale em baixa confiança.

Passo Modelo Limite de Confiança Ação se Limite Não for Atendido
1 Luna Confiança > 85% Retornar resultado
2 Terra Confiança > 75% Retornar resultado (escalado)
3 Sol Confiança > 60% Retornar resultado ou falhar explicitamente
4 Revisão humana Escalar para humano

Cenário real: Você está fazendo classificação de documentos para faturas (classificar por fornecedor). Luna retornará resultados de alta confiança (~94% de sucesso) e custará ~$1,20 por 1K. Para os 6% de faturas ambíguas onde Luna retorna confiança < 85%, escale para Terra (~94% de sucesso para casos difíceis), custando ~$3,75 por 1K de escalações. Se 6% de 10K documentos escalam: 600 × $3,75 = $2,25 extras, total $12 + $2,25 = $14,25/10K. Terra puro custaria ~$37,50. Cascata economiza 62% enquanto melhora a precisão em casos limites.

5. Economia de Cache de Prompts

GPT-5.6 mudou os custos de cache: gravações de cache agora custam 1,25× a taxa de entrada sem cache (não gratuito), e leituras de cache custam 10% de entrada.

Cenário Tamanho de Prefixo Custo de Gravação Custo de Leitura (por acerto) Acertos de Ponto de Equilíbrio Economia @ 10 acertos/mês
Contexto de recuperação em cache Luna 100K tokens $0,125 $0,010 15 acertos -$0,025 (perda)
Prompt do sistema em cache Luna + docs 50K tokens $0,063 $0,005 8 acertos $0,032
Contexto de agentes em cache Terra 80K tokens $0,250 $0,020 14 acertos $0,030
Contexto de raciocínio em cache Sol 100K tokens $0,625 $0,050 13 acertos $0,025

Quando cachear: Se seu prompt inclui um prefixo estável (instruções do sistema, documentação, exemplos com poucos disparos) que é reutilizado mais de 5–10 vezes em uma janela de 30 minutos, o cache geralmente economiza dinheiro. A API de lote (50% de desconto) agora compete com cache em custo — se você classifica documentos em lote, o desconto de lote vence a sobrecarga de cache.

6. Comparação com Claude Sonnet 5, Gemini 3.1 Pro e DeepSeek V4

Modelo Entrada $/1M Saída $/1M Velocidade Capacidade de Raciocínio Quando Escolher
GPT-5.6 Luna $1,00 $6,00 Rápido Seguimento de instruções, roteamento Classificação, extração, rendimento
GPT-5.6 Terra $2,50 $15,00 Médio Raciocínio moderado, uso de ferramentas Agentes, multi-turno, código médio
GPT-5.6 Sol $5,00 $30,00 Lento Raciocínio de fronteira, pesquisa Código complexo, raciocínio difícil, problemas novel
Claude Sonnet 5 $2,00–$3,00 $10,00–$15,00 Médio–Rápido Raciocínio forte, tokens de raciocínio longo Raciocínio, codificação (competitivo com Sol)
Gemini 3.1 Pro $2,00 $12,00 Médio Multimodal, capacidade de pesquisa Tarefas multimodais, competitivo com Terra
DeepSeek V4 Flash $0,14 $0,28 Muito Rápido Raciocínio básico, foco em entrada em cache Roteamento de alto volume, cargas de trabalho com foco em cache (7–35× mais barato)

Arbitragem de custos: Para classificação simples e extração, DeepSeek V4 Flash é 7–20× mais barato que Luna. Compare com seus dados — se atinge 90%+ de precisão, use-o e guarde a diferença. Claude Sonnet 5 é 2× mais caro que Terra, mas fornece raciocínio mais forte por pretensão de capacidade de modelo; use-o se seu benchmark de Terra mostrar qualidade insuficiente. Gemini 3.1 Pro fica entre Luna e Terra — útil se você precisa de entrada multimodal ou já está no ecossistema Vertex AI.

7. Migração de GPT-5/5.5 & Status de Deprecação

A OpenAI continua oferecendo GPT-5.5 ($5/$30, igual ao Sol) e GPT-5.4 ($2,50/$15, igual ao Terra) junto com GPT-5.6. Não há pressão de deprecação em modelos mais antigos — você pode continuar usando GPT-5.5 se seu código o alvo. No entanto, GPT-5.6 pretende paridade de desempenho (ou melhor) no mesmo nível, portanto migre para 5.6 para novas implantações.

A interface ChatGPT continua aposentando modelos mais antigos continuamente (GPT-4o mini, GPT-4 turbo agora são apenas leitura); o acesso pela API é estável. Se você constrói contra a API, planeje revisões anuais do status de deprecação de modelo, mas não espere urgência.

Estrutura de Medição de Custos

Passo 1: Estabelecer linha de base por nível

Execute uma semana de tráfego e registre qual nível lidou com cada solicitação. Isso fornece distribuição de linha de base e custo.

Passo 2: Medir pontuações de confiança e taxas de fallback

Para cada nível, registre confiança retornada. Calcule: qual % de chamadas Luna têm confiança > 85%? Qual % escala para Terra? Isso diz se sua cascata está equilibrada.

Passo 3: Auditar sucesso/fracasso por nível

Compare saída do modelo contra verdade fundamental por uma semana. Qual nível tem desempenho insuficiente em seus dados? Ajuste limites ou seleção de nível com base em precisão real, não em pretensões da OpenAI.

Passo 4: Calcular custo verdadeiro por resposta bem-sucedida

Custo verdadeiro = (custo_nível) / (taxa_sucesso). Se Luna custa $1,20 por 1K com 94% de sucesso, o custo por resposta que funciona é $1,28. Essa é a métrica a otimizar.

Lista de Verificação Rápida de Seleção de Nível


A seleção de nível é um problema de classificação: combine propriedades de carga de trabalho com economia de nível. O ideal é roteamento em cascata — rotei para Luna primeiro, meça confiança, escale na incerteza. Isso minimiza custo mantendo qualidade. A FinOps LLM pode executar uma auditoria de custos em seu tráfego de LLM e mostrar onde o desajuste de nível está deixando dinheiro na mesa. Agende uma auditoria gratuita.

Veja também: Quanto Custa GPT-5? para o panorama completo de preços de GPT e Custos Ocultos de LLM para infraestrutura e gastos indiretos de fallback além de taxas por token.

Voltar para pesquisa