Saltar para o conteúdo

Modelo de custos do GPT-6 Luna

Atualizado September 23, 2026 · publicado originalmente September 23, 2026

O GPT-6 Luna é o modelo econômico da família GPT-6 da OpenAI, lançado em 22 de setembro de 2026 junto com o GPT-6 Sol. A OpenAI o direciona a trabalhos de alto volume com um objetivo claro: resumir, extrair dados e responder perguntas rápidas. Com $0.10 por 1M de tokens de entrada, é o modelo para o qual se deve rotear primeiro, e do qual só se sai quando a tarefa provar que precisa de mais.

Preços do GPT-6 Luna

NívelEntradaEntrada em cacheSaída
Padrão$0.10$0.01$0.50
Batch ou flex$0.05$0.005$0.25
Modo rápido$0.20$0.02$1.00
Contexto longo (acima de 272K de entrada)$0.20$0.02$0.75

Por 1M de tokens, conforme a página de preços da OpenAI. Uma gravação em cache custa $0.125. O Luna tem a mesma janela de contexto de 1,050,000 tokens do restante do GPT-6, data de corte de conhecimento em maio de 2026 (a mais recente dos três) e toda a faixa de esforço, de none a max.

Mesma pontuação do GPT-5.6 Luna, 61% mais barato por tarefa

A Artificial Analysis avaliou as duas gerações do Luna no seu Intelligence Index (v4.3.2) com esforço máximo.

ModeloPontuação do índiceCusto por tarefaVelocidade de saída
GPT-6 Luna (max)37$0.07132.2 tokens/s
GPT-5.6 Luna (max)37$0.18142.3 tokens/s
GPT-6 Sol (low)33.9$0.13—

A pontuação não mudou. O custo por tarefa caiu 61%, principalmente pelo menor preço por token. O GPT-6 Luna em max também supera o GPT-6 Sol em esforço low tanto em pontuação quanto em custo. Se você usava o Sol em low para economizar, o Luna em max é um negócio melhor neste índice.

Quanto custa o alto volume

Um milhão de requisições de classificação por mês, cada uma com 600 tokens de entrada e 100 de saída, sem cache:

ModeloCusto mensal
GPT-6 Luna, batch$55
GPT-6 Luna$110
GPT-5.6 Luna$240
Claude Haiku 4.5$1,100
GPT-6 Sol$2,200
GPT-6 Astra$11,000

O Claude Haiku 4.5 custa 10× mais por token e marcou 15 no mesmo índice, por ser um modelo sem raciocínio. Mover o mesmo trabalho do Sol para o Luna reduz a conta em 95%, e é por isso que vale a pena construir um roteador que envie apenas os casos difíceis ao Sol.

O porém: latência e verbosidade

Os números do índice acima são em esforço máximo, e nesse nível o Luna demora a começar. A Artificial Analysis mediu 104 segundos até o primeiro token. Ele também usou 150M de tokens de saída no índice inteiro, contra uma mediana de 84M, o que a Artificial Analysis descreve como um tanto verboso. Essa verbosidade já está dentro dos $0.07 por tarefa, então o número de custo se mantém, mas a espera não serve para um chat voltado ao usuário.

Para tráfego interativo, execute o Luna em none, low ou no padrão medium e meça a precisão com os seus próprios prompts. As pontuações desta página são só para esforço máximo, então a precisão em configurações mais baixas é algo a testar, não a consultar. Reserve o esforço máximo para jobs em batch, onde a latência não importa e o preço batch reduz a conta pela metade de novo.

Os limites de taxa escalam mais que no Sol

O Luna começa em 500K tokens por minuto no Tier 1, igual ao Sol, mas chega a 180M de tokens por minuto no Tier 5 (o Sol para em 40M), com até 30,000 requisições por minuto. Para pipelines em massa, essa folga importa tanto quanto o preço.

Como usar o Luna

Fontes: página do modelo GPT-6 Luna da OpenAI, Artificial Analysis: GPT-6 Luna, Artificial Analysis: GPT-5.6 Luna, TechCrunch. Preços consultados em 23 de setembro de 2026.

Artigos relacionados


Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →

Voltar a finopsllm.com