跳至正文

OpenAI Ultrafast API 定价与速度

更新于 October 7, 2026 · 首次发布 September 27, 2026

OpenAI Ultrafast 以标准 token 价格的 6 倍,加快 GPT-6 Astra 的输出生成速度。当前指南称生成速度最高可快 8 倍;DevDay 公告则称最高可快 6 倍。两者都不保证端到端延迟。在把生产流量路由到它之前,请把新增的推理费用与实测完成时间和业务价值进行对比。

Ultrafast 改变了什么?

Ultrafast 缩短了相邻生成输出 token 之间的时间。它并不会让请求的每个环节都快 8 倍:输入处理、网络建立、工具、应用代码以及等待外部服务,仍然会影响总延迟。OpenAI 建议使用 WebSockets,尤其适用于快速连续调用多次工具的智能体,因为连接开销可能会抵消部分收益。

GPT-6 Astra Ultrafast 的价格是多少?

OpenAI 的价格表列出了短上下文 GPT-6 Astra 请求每 1M 个文本 token 的以下价格:

层级输入缓存输入缓存写入输出
标准$10$1$12.50$50
Ultrafast$60$6$75$300

在每一类 token 上,Ultrafast 都是标准列表费率的 6 倍。编列预算前请查看实时定价页,因为费率和资格可能变化。Ultrafast 支持全球处理和美国数据驻留,但不支持欧盟或其他非美国地区的处理端点。在受支持的地方,可能适用区域及 FedRAMP 的价格调整。

这份溢价对每项任务意味着什么?

以下是一个假设性的未缓存请求:8,000 个输入 token 和 2,000 个输出 token。按标准费率,成本为 $0.18:输入 $0.08,输出 $0.10。按 Ultrafast 费率,成本为 $1.08:输入 $0.48,输出 $0.60。每项任务的溢价为 $0.90。这个示例使用已公布的 token 价格和假设的 token 数量,并不能预测某个工作负载的延迟或业务价值。

对于真实的工作负载,请把每月的输入、缓存输入、缓存写入和输出 token 数分别乘以各层级的当前价格。比较不同层级时,请保持相同的模型、提示词、推理设置和任务组合。

什么时候 Ultrafast 的溢价是值得的?

请在模型生成时间会影响可衡量结果的任务上测试它:带有延迟目标的交互式助手、等待下一步操作的实时工作流,或是更快的轮次能减少付费空闲时间的智能体。比较 p50 和 p95 的端到端完成时间、成功率以及每个成功任务的成本。只有当节省的实测时间价值超过增量成本时,才值得支付这份溢价。

对于离线丰富化、定时摘要以及其他可以等待的工作,标准层级或有折扣的处理选项可能更合适。对于超出 Ultrafast 速率限制的请求,请保留备用路由。

谁可以使用,适用哪些限制?

OpenAI 当前的 Ultrafast 指南称,API 客户可在默认速率限制下使用 GPT-6 Astra。文档中的默认每分钟 token 限额为:Build 层级 500,000,Launch 层级 1,000,000,Grow 层级 5,000,000。更高的限额可能需要向 OpenAI 的客户团队申请。

哪些来源记录了定价和速度声明?

主要来源:OpenAI Ultrafast 模式指南、OpenAI API 定价,以及 OpenAI DevDay 2026 回顾。另请参阅模型路由和每用户 LLM 成本基准。

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com