跳至正文

OpenAI O / AON 常驻智能体成本模型

更新于 September 27, 2026 · 首次发布 September 27, 2026

泄露的参考资料显示,OpenAI 的 “O”(代号 AON)是一款面向长周期任务的常驻助手。与只响应一次便停止的聊天模型不同,O 拥有自己的云端环境,可以搭建执行上下文、编写代码、开展研究,并持续运行数小时、数天,甚至可能数周。它可能让多个智能体在同一任务上相互通信。预计发布时间:2026 年 9 月 29 日的 OpenAI Dev Day。

成本建模有哪些变化

传统 LLM 成本:每次请求的 token 数 × 费率。O/AON 的成本:时长 × 分配的算力 + token 吞吐量。

维度聊天/补全 APIO / AON(预计)
计费单位每 1M token每小时(算力)+ 每 1M token
空闲成本$0>$0(环境预留)
最长时长数分钟(超时)数天或数周
并行度顺序请求多智能体集群
状态通过上下文传递持久化环境

预计成本模型(推测性,基于泄露信息的模式)

OpenAI 尚未公布价格。以下是两种可能的结构:

方案 A:算力小时 + token(类似 Codespaces)

一次 24 小时的智能体运行,输入 5M token,输出 2M token:

组成部分成本(低)成本(高)
24 小时环境($1/小时)$24$48
5M 输入 token @ $5/MTok$25$25
2M 输出 token @ $15/MTok$30$30
合计$79$103

方案 B:固定订阅(Pro Max 套餐)

常驻智能体的成本优化策略

  1. 挂起,而非终止。如果环境会持续存在,在空闲期间暂停智能体循环,而不是关闭环境。冷启动的成本高于空闲时的预留成本。
  2. 批量处理子任务的 token。累积子任务结果,并以更大的块写入上下文,以提高持久化环境上的缓存命中率。
  3. 将子任务路由到更便宜的模型。O/AON 负责编排;编码交给 Sonnet 5.5,研究交给 Flash 系列模型,只有关键决策才升级到高端模型。
  4. 为每个目标设置硬性的时间和金额预算。例如 “解决这个 bug,最多 $10 / 2 小时”,并由编排器强制执行,而不是寄希望于模型自觉。

何时使用 O/AON,何时使用 Opus 5.5 长时间运行

相关阅读

参见 ChatGPT Pro Max 经济性、OpenAI 超快 API 定价、Opus 5.5 25 小时智能体成本,以及智能体经济性。

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com