Preço e velocidade da API OpenAI Ultrafast
Atualizado October 7, 2026 · publicado originalmente September 27, 2026
O OpenAI Ultrafast acelera a geração de saída do GPT-6 Astra por seis vezes o preço dos tokens Standard. O guia atual afirma geração até oito vezes mais rápida; o anúncio do DevDay falava em até seis vezes. Nenhum dos dois números garante a latência de ponta a ponta. Compare a cobrança adicional de inferência com o tempo de conclusão medido e o valor de negócio antes de direcionar tráfego de produção para esta camada.
O que o Ultrafast muda?
O Ultrafast reduz o intervalo entre os tokens de saída gerados. Ele não deixa cada parte da requisição oito vezes mais rápida: o processamento da entrada, o estabelecimento da rede, as ferramentas, o código da aplicação e a espera por serviços externos continuam afetando a latência total. A OpenAI recomenda WebSockets, principalmente para agentes que fazem várias chamadas de ferramentas em sequência rápida, porque a sobrecarga de conexão pode anular parte do ganho.
Quanto custa o GPT-6 Astra Ultrafast?
A tabela de preços da OpenAI lista o seguinte por um milhão de tokens de texto para requisições de contexto curto do GPT-6 Astra:
| Camada | Entrada | Entrada em cache | Gravação em cache | Saída |
|---|---|---|---|---|
| Standard | $10 | $1 | $12.50 | $50 |
| Ultrafast | $60 | $6 | $75 | $300 |
O Ultrafast custa 6× a tarifa Standard listada para cada categoria de token. Confira a página de preços atual antes de orçar, pois tarifas e elegibilidade podem mudar. O Ultrafast oferece processamento global e residência de dados nos EUA; não oferece endpoints de processamento regional na UE nem em outras regiões fora dos EUA. Ajustes de preço regionais e de FedRAMP podem se aplicar onde houver suporte.
O que o prêmio significa por tarefa?
Considere uma requisição hipotética sem cache com 8,000 tokens de entrada e 2,000 de saída. Nas tarifas Standard, custa $0.18: $0.08 de entrada e $0.10 de saída. Nas tarifas Ultrafast, custa $1.08: $0.48 de entrada e $0.60 de saída. O prêmio é de $0.90 por tarefa. Este exemplo usa preços de tokens publicados e contagens de tokens presumidas; ele não prevê a latência nem o valor de negócio de uma carga real.
Para uma carga real, multiplique os tokens mensais de entrada, entrada em cache, gravação em cache e saída pelos preços atuais de cada camada. Mantenha o mesmo modelo, os mesmos prompts, as mesmas configurações de raciocínio e a mesma mistura de tarefas ao comparar as camadas.
Quando o Ultrafast compensa o prêmio?
Teste-o em trabalhos nos quais o tempo de geração do modelo afeta um resultado mensurável: um assistente interativo com meta de latência, um fluxo ao vivo que espera a próxima ação ou um agente em que turnos mais rápidos reduzem o tempo ocioso pago. Compare o tempo de conclusão de ponta a ponta em p50 e p95, a taxa de sucesso e o custo por tarefa concluída com sucesso. Use o prêmio apenas quando o tempo economizado medido valer mais do que o custo incremental.
Para enriquecimento offline, resumos agendados e outros trabalhos que podem esperar, Standard ou uma opção de processamento com desconto pode ser mais adequada. Mantenha uma rota de contingência para requisições que excedam o limite de taxa do Ultrafast.
Quem pode usar e quais limites se aplicam?
O guia atual do Ultrafast da OpenAI diz que o acesso ao GPT-6 Astra está disponível para clientes da API com limites de taxa padrão. Os limites padrão documentados de tokens por minuto são 500,000 para Build, 1,000,000 para Launch e 5,000,000 para Grow. Limites maiores podem exigir uma solicitação à equipe de contas da OpenAI.
Quais fontes documentam os preços e as afirmações de velocidade?
Fontes primárias: guia do modo Ultrafast da OpenAI, preços da API da OpenAI e resumo do OpenAI DevDay 2026. Veja também roteamento de modelos e benchmarks de custo de LLM por usuário.
Artigos relacionados
- Roteamento de modelos
- Benchmarks de custo de LLM por usuário
- ChatGPT Pro Max: a economia do plano de $500
- Como limitar os custos de inferência
Quer aplicar isto à sua plataforma? Traga as faturas dos fornecedores, os registos do gateway e os principais fluxos de trabalho; mapearemos os custos e as oportunidades de poupança. Marcar auditoria gratuita →