跳至正文

我们 98% 的 Codex 输入 token 命中缓存:不用缓存,账单会大 12 倍

更新于 October 9, 2026 · 首次发布 October 9, 2026

快速结论: 在 ChatGPT Pro $100 上重度使用 Codex 的 12 天里,我们发送了 13.0B 个输入 token,收到 47M 个输出 token。其中 97.6% 的输入命中了缓存。按 OpenAI API 价格计算,这些工作合计为 $1,211。如果同样的 token 一次缓存都不命中,则为 $14,198,贵了 12 倍。 输入与输出之比:大约每个输出 token 对应 279...

在 ChatGPT Pro $100 上重度使用 Codex 的 12 天里,我们发送了 13.0B 个输入 token,收到 47M 个输出 token。其中 97.6% 的输入命中了缓存。按 OpenAI API 价格计算,这些工作合计为 $1,211。如果同样的 token 一次缓存都不命中,则为 $14,198,贵了 12 倍。

按模型划分的 12 天 Codex API 价值:缓存与未缓存对比 $0 $2k $4k $6k $8k $10k $12k $14k $1,073 $13,299 Sol $95 $655 Luna $27 $144 GPT-5.5 $16 $99 Astra 橙色:按 API 计价,我们实际付出的(有缓存) 蓝色:同样的 token,无缓存命中
按模型划分的 12 天 Codex API 价值:缓存与未缓存对比

为什么编码智能体几乎全是缓存输入

智能体循环在每一步都会重新发送整段对话:系统提示词、工具定义、它读过的文件,以及之前的每一条工具结果。每一步只增加一点点,却要重读全部内容。因此输入量随会话长度呈平方增长,而输出始终很小。12 天下来,我们的输入与输出之比是 279:1。

让这一切保持可承受的,正是提示缓存。OpenAI API 上的缓存输入只要普通输入的十分之一甚至更低。承担了我们大部分工作的 GPT-6 Sol,普通输入每百万 token 收费 $2,缓存则为每百万 $0.10。

钱都花在了哪里

模型 输入 tokens 缓存占比 输出 tokens API 价值 若无缓存
Sol 6.56B 98.1% 17.5M $1,073 $13,299
Luna 6.41B 97.2% 29.0M $95 $655
GPT-5.5 0.03B 93.5% 0.2M $27 $144
Astra 0.01B 94.5% 0.0M $16 $99
合计 13.01B 97.6% 47M $1,211 $14,198
成本构成 API 价值 占比
缓存输入 $728 60%
未缓存输入 $288 24%
输出 $196 16%

即使享有 95% 的折扣,缓存输入仍是最大的单项支出。这正是智能体工作负载的特征:最便宜的 token 类型,却以惊人的数量出现。各模型的合计数据见 codex-pro-100-model-mix.csv。

什么会打破缓存

缓存命中需要完全相同的前缀。任何改变上下文开头的操作,都会迫使其后的所有内容按全价重读。

这对你的 Codex 限额意味着什么

如果 Codex 仪表对缓存输入的计量接近其 API 价格,那么缓存命中率下降 1 个百分点都会很贵。以我们的用量,如果 Sol 的缓存率从 98.1% 降到 90%,仅 Sol 的输入就会多出约 $1,004,大约相当于多消耗 6 个 Pro $100 窗口。缓存纪律就是配额纪律。关于一个窗口能容纳多少,见我们对 Pro $100 倍率的实测;关于我们如何在 12 天内拿到 8 个窗口,见重置日志。

我们如何测量

Codex 会把每个会话的 JSONL 日志写到 ~/.codex/sessions/ 下。每次请求都记录累计的输入、缓存输入和输出 token,以及周仪表(used_percent)及其 resets_at 时间。我们按每次请求所用模型的 API 标价计算其 token 增量,并按周窗口分组。美元数字是按 API 计算的等价价值,而不是我们实际支付的金额。

来源

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com