我们 98% 的 Codex 输入 token 命中缓存:不用缓存,账单会大 12 倍
更新于 October 9, 2026 · 首次发布 October 9, 2026
在 ChatGPT Pro $100 上重度使用 Codex 的 12 天里,我们发送了 13.0B 个输入 token,收到 47M 个输出 token。其中 97.6% 的输入命中了缓存。按 OpenAI API 价格计算,这些工作合计为 $1,211。如果同样的 token 一次缓存都不命中,则为 $14,198,贵了 12 倍。
- 输入与输出之比:大约每个输出 token 对应 279 个输入 token。
- 缓存输入在账单中的占比:60%,即使折扣高达 95%。
- 输出在账单中的占比:16%。
为什么编码智能体几乎全是缓存输入
智能体循环在每一步都会重新发送整段对话:系统提示词、工具定义、它读过的文件,以及之前的每一条工具结果。每一步只增加一点点,却要重读全部内容。因此输入量随会话长度呈平方增长,而输出始终很小。12 天下来,我们的输入与输出之比是 279:1。
让这一切保持可承受的,正是提示缓存。OpenAI API 上的缓存输入只要普通输入的十分之一甚至更低。承担了我们大部分工作的 GPT-6 Sol,普通输入每百万 token 收费 $2,缓存则为每百万 $0.10。
钱都花在了哪里
| 模型 | 输入 tokens | 缓存占比 | 输出 tokens | API 价值 | 若无缓存 |
|---|---|---|---|---|---|
| Sol | 6.56B | 98.1% | 17.5M | $1,073 | $13,299 |
| Luna | 6.41B | 97.2% | 29.0M | $95 | $655 |
| GPT-5.5 | 0.03B | 93.5% | 0.2M | $27 | $144 |
| Astra | 0.01B | 94.5% | 0.0M | $16 | $99 |
| 合计 | 13.01B | 97.6% | 47M | $1,211 | $14,198 |
| 成本构成 | API 价值 | 占比 |
|---|---|---|
| 缓存输入 | $728 | 60% |
| 未缓存输入 | $288 | 24% |
| 输出 | $196 | 16% |
即使享有 95% 的折扣,缓存输入仍是最大的单项支出。这正是智能体工作负载的特征:最便宜的 token 类型,却以惊人的数量出现。各模型的合计数据见 codex-pro-100-model-mix.csv。
什么会打破缓存
缓存命中需要完全相同的前缀。任何改变上下文开头的操作,都会迫使其后的所有内容按全价重读。
- 会话中途切换模型。新模型没有你上下文的缓存。
- 会话中途修改指令或工具列表。它们位于提示词顶部,因此下面的所有内容都要重读。
- 长时间停顿。缓存会过期。中断后再回来,会按全价重读整个会话。
- 压缩。总结历史会改写前缀。它之后能节省 token,但眼下要付出一次未缓存的完整处理成本。
这对你的 Codex 限额意味着什么
如果 Codex 仪表对缓存输入的计量接近其 API 价格,那么缓存命中率下降 1 个百分点都会很贵。以我们的用量,如果 Sol 的缓存率从 98.1% 降到 90%,仅 Sol 的输入就会多出约 $1,004,大约相当于多消耗 6 个 Pro $100 窗口。缓存纪律就是配额纪律。关于一个窗口能容纳多少,见我们对 Pro $100 倍率的实测;关于我们如何在 12 天内拿到 8 个窗口,见重置日志。
我们如何测量
Codex 会把每个会话的 JSONL 日志写到 ~/.codex/sessions/ 下。每次请求都记录累计的输入、缓存输入和输出 token,以及周仪表(used_percent)及其 resets_at 时间。我们按每次请求所用模型的 API 标价计算其 token 增量,并按周窗口分组。美元数字是按 API 计算的等价价值,而不是我们实际支付的金额。
来源
相关文章
- ChatGPT Pro $100 实际是 Plus 的 2.6 倍
- 12 天内 8 个 Codex 周窗口
- Codex 重置让 $40 变成 $1,211
- ChatGPT Pro 包含多少 Codex 用量
- Claude Max 20x 对比 ChatGPT Pro
想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →