OpenAI O / AON 常驻智能体成本模型
更新于 September 27, 2026 · 首次发布 September 27, 2026
泄露的参考资料显示,OpenAI 的 “O”(代号 AON)是一款面向长周期任务的常驻助手。与只响应一次便停止的聊天模型不同,O 拥有自己的云端环境,可以搭建执行上下文、编写代码、开展研究,并持续运行数小时、数天,甚至可能数周。它可能让多个智能体在同一任务上相互通信。预计发布时间:2026 年 9 月 29 日的 OpenAI Dev Day。
成本建模有哪些变化
传统 LLM 成本:每次请求的 token 数 × 费率。O/AON 的成本:时长 × 分配的算力 + token 吞吐量。
| 维度 | 聊天/补全 API | O / AON(预计) |
|---|---|---|
| 计费单位 | 每 1M token | 每小时(算力)+ 每 1M token |
| 空闲成本 | $0 | >$0(环境预留) |
| 最长时长 | 数分钟(超时) | 数天或数周 |
| 并行度 | 顺序请求 | 多智能体集群 |
| 状态 | 通过上下文传递 | 持久化环境 |
预计成本模型(推测性,基于泄露信息的模式)
OpenAI 尚未公布价格。以下是两种可能的结构:
方案 A:算力小时 + token(类似 Codespaces)
- 环境预留:约每小时 $0.50 至 $2.00(CPU、内存和存储)
- token 吞吐量:在此之上按标准 GPT-5 费率计费
- 超快层级:启用时为 5 至 10 倍的 token 倍率
一次 24 小时的智能体运行,输入 5M token,输出 2M token:
| 组成部分 | 成本(低) | 成本(高) |
|---|---|---|
| 24 小时环境($1/小时) | $24 | $48 |
| 5M 输入 token @ $5/MTok | $25 | $25 |
| 2M 输出 token @ $15/MTok | $30 | $30 |
| 合计 | $79 | $103 |
方案 B:固定订阅(Pro Max 套餐)
- 每月 $500 的 ChatGPT Pro Max 包含 O/AON 访问权限及超快配额
- 实际小时成本:$500 / 720 小时 = $0.69/小时(若每天 24 小时、每周 7 天运行)
- 与方案 A 的盈亏平衡点:约每天持续使用 15 小时
常驻智能体的成本优化策略
- 挂起,而非终止。如果环境会持续存在,在空闲期间暂停智能体循环,而不是关闭环境。冷启动的成本高于空闲时的预留成本。
- 批量处理子任务的 token。累积子任务结果,并以更大的块写入上下文,以提高持久化环境上的缓存命中率。
- 将子任务路由到更便宜的模型。O/AON 负责编排;编码交给 Sonnet 5.5,研究交给 Flash 系列模型,只有关键决策才升级到高端模型。
- 为每个目标设置硬性的时间和金额预算。例如 “解决这个 bug,最多 $10 / 2 小时”,并由编排器强制执行,而不是寄希望于模型自觉。
何时使用 O/AON,何时使用 Opus 5.5 长时间运行
- O/AON:多日研究、持续监控、多智能体协作,以及需要持久化环境状态的任务
- Opus 5.5 智能体循环:单一目标的编码任务(以小时计,而非以天计)、定义明确的交付物、一次性执行
相关阅读
参见 ChatGPT Pro Max 经济性、OpenAI 超快 API 定价、Opus 5.5 25 小时智能体成本,以及智能体经济性。
相关文章
想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →