Modelo de custo da API Decisions da OpenAI: preço só sobre a entrada e saídas tipadas rápidas
Atualizado October 7, 2026 · publicado originalmente October 7, 2026
A API Decisions da OpenAI é um endpoint em beta que transforma evidências compartilhadas de texto ou imagem em classificações, escolhas ou pontuações tipadas. Com o GPT-6 Luna, ela cobra $0.10 por milhão de tokens de entrada e não cobra tokens de cache nem de saída. Trate a afirmação de «10x mais rápida» como um sinal de latência e, em seguida, teste a qualidade e o custo total da tarefa na sua própria carga de trabalho.
O que a OpenAI lançou em 6 de outubro de 2026?
A OpenAI adicionou a API Decisions em beta público em 6 de outubro de 2026. O guia do Decisions afirma que ela retorna respostas tipadas cerca de 10 vezes mais rápido que a API Responses. No lançamento, o GPT-6 Luna é o único modelo compatível e as requisições usam POST /v1/decisions. A comparação de velocidade é uma afirmação publicada pela OpenAI, não uma promessa de que toda aplicação verá a mesma melhoria de ponta a ponta.
Uma requisição carrega uma entrada compartilhada e uma ou mais perguntas. Cada pergunta pode pedir um predicado (a probabilidade de uma condição ser verdadeira), uma escolha dentro de um conjunto fornecido ou uma pontuação em níveis ordenados. O endpoint devolve essas respostas de forma tipada, com probabilidades ou informações de confiança. Isso o torna adequado para decisões delimitadas, como rotear um ticket de suporte, sinalizar possível dano na foto de um produto ou pontuar a gravidade de um incidente.
Como funciona a cobrança da API Decisions?
Para o endpoint Decisions, a OpenAI lista $0.10 por milhão de tokens de entrada com o GPT-6 Luna. O guia diz que apenas os tokens de entrada são cobrados: não há cobrança de leitura de cache, escrita de cache nem de tokens de saída. Isso difere de uma requisição Responses comum ao GPT-6 Luna, em que as tarifas padrão de contexto curto são $0.10 por milhão de tokens de entrada sem cache, $0.01 para entrada em cache, $0.125 para escritas em cache e $0.50 para tokens de saída. Use os termos de preço específicos do Decisions para este endpoint, não a tabela completa do modelo.
Veja uma estimativa hipotética, antes de qualquer ajuste regional ou de contexto longo aplicável: se uma requisição média usa 1,200 tokens de entrada, sua cobrança de tokens é 1,200 ÷ 1,000,000 × $0.10 = $0.00012. Um milhão dessas requisições usaria 1.2 bilhão de tokens de entrada e custaria cerca de $120. Este é um exemplo de planejamento, não uma cotação; meça o uso real de tokens e confirme a tarifa vigente antes de definir um orçamento.
Como os tokens de saída não são uma categoria cobrada aqui, conte com cuidado toda a entrada: a evidência, o contexto de sistema incluído na requisição e as instruções e opções de cada pergunta. Quando fizer sentido, envie perguntas independentes sobre a mesma entrada em uma única requisição. A OpenAI documenta que perguntas independentes podem compartilhar evidências; perguntas que dependem de respostas anteriores devem ser enviadas em chamadas separadas. Mantenha as perguntas curtas e observáveis para que a requisição não gaste tokens com rubricas ambíguas.
Quando uma equipe deve usar Decisions em vez de Responses?
Use Decisions quando o resultado for inerentemente delimitado: «Esta imagem tem dano visível?», «Qual destas três filas é responsável por este ticket?» ou «Qual a gravidade deste incidente de acordo com estes níveis explícitos?». Ele devolve uma resposta que a aplicação pode rotear ou contabilizar sem pedir a um modelo de uso geral que escreva um parágrafo e depois analisar esse texto.
Mantenha o Responses para tarefas que exijam explicação, esquemas JSON arbitrários, texto gerado, chamadas de ferramentas ou uma decisão que requeira uma conversa com o modelo. O guia da OpenAI direciona explicitamente os desenvolvedores para o Structured Outputs quando precisam de um objeto JSON personalizado e para o function calling quando o modelo deve solicitar uma chamada de ferramenta. Uma escolha tipada não substitui uma explicação fundamentada nem uma ação executável.
A comparação correta é o custo por resultado de negócio correto, e não tokens ou latência isoladamente. Um classificador rápido que gera falsos positivos caros pode aumentar o trabalho de revisão. Um endpoint de preço baixo ainda pode sair perdendo se as equipes compensarem com prompts repetidos, revisão manual ou correção posterior. Acompanhe os campos de uso e de resposta do Decisions, compare amostras de resultados com exemplos rotulados e inclua a revisão humana e o tratamento posterior no custo por caso roteado com sucesso.
Como o FinOps pode validar a alegação de economia?
- Escolha uma carga de trabalho delimitada. Selecione uma etapa de classificação ou pontuação de alto volume, com um conjunto de respostas claro e um custo de erro mensurável.
- Monte um conjunto de teste rotulado. Meça a precisão por categoria e inspecione a calibração de confiança ou probabilidade. Defina os limites de revisão humana com base no custo de falsos positivos e falsos negativos, como a OpenAI recomenda.
- Execute um piloto comparável. Compare o caminho atual de produção e o Decisions com entradas equivalentes. Registre a latência do endpoint, tokens, novas tentativas, taxa de revisão e o custo dos erros corrigidos.
- Orce a rota completa. Some armazenamento, computação da aplicação, tempo de revisores e quaisquer chamadas posteriores ao Responses ou a ferramentas. O preço por token do Decisions não torna o restante do fluxo gratuito.
- Mantenha uma rota de saída. O endpoint está em beta público. Fixe o endpoint e o modelo na configuração, acompanhe o changelog e teste novamente antes de uma implantação ampla se o comportamento ou a disponibilidade mudarem.
A OpenAI documenta o suporte a Zero Data Retention e o uso com HIPAA para clientes elegíveis, além de opções de residência nos EUA e na Europa (EEE e Suíça), com requisitos de elegibilidade e de contrato. Confirme esses controles na configuração real da sua organização antes de colocar dados regulados em um piloto.
O que um comprador deve lembrar sobre o preço da API Decisions?
A API Decisions oferece uma nova combinação de preço e latência para decisões compactas e tipadas: na tarifa publicada do GPT-6 Luna, a entrada custa $0.10 por milhão de tokens e os tokens de saída gerados não têm cobrança. Seus melhores candidatos têm evidências reutilizáveis, tipos de resposta claros e formas de baixo custo de capturar resultados incertos. Meça a qualidade da tarefa e o custo operacional total antes de migrar o volume de produção.
Quais pesquisas relacionadas as equipes devem ler?
- Saída estruturada não é de graça
- Custo por tarefa bem-sucedida supera custo por requisição
- Cortes de preço de modelos não reduzem automaticamente sua conta de IA
Artigos relacionados
- Saída estruturada não é de graça
- Custo por tarefa bem-sucedida
- Cortes de preço de modelos e orçamentos de roteamento
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →