跳至正文

静默模型降级与成本模型

更新于 September 27, 2026 · 首次发布 September 27, 2026

2026 年 9 月 23 日,r/GroundTruthAINews 上的一个帖子指出,Anthropic 的 Opus 5.5 发布说明里埋着一条脚注:一次 Opus 5.5 请求可能由 Opus 4.8 响应。当天下午,Anthropic 和 OpenAI 同时宣布了降价。两家实验室卖的是同一个理念:保持能力,大幅降低支出。对 FinOps 来说,重要的是那条脚注。

实际发生了什么

Claude Opus 5.5 以每百万 token $4/$20 的价格发布,比 Opus 5 便宜约 20%,缓存读取降低 60%,至 $0.20。Anthropic 表示,每个任务使用的 token 更少,输出速度快 30%,使典型工作负载的成本降低约 40%。大约 90 分钟后,OpenAI 发布了 GPT-6 Sol,价格为 $2/$10,Luna 为 $0.10/$0.50,均为 GPT-5.6 价格的一半。

这一时期的每篇发布文章都带有同类脚注:你调用的端点是一个别名,而在过渡窗口期内,该别名会在多个模型版本之间做负载均衡。这是常规的容量管理做法。但它也是成本建模的一个问题。

为什么它会打乱数字

如何检测这种切换

所有主流服务商都会在响应体中返回实际解析后的模型。把它记录下来。一个字段,四行代码:

resolved = response.model  # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS

然后按实际解析的模型而非你请求的模型,拆分每一项成本指标。一旦某个分组开始漂移,答案就出来了:别名在混用版本,你的单任务成本实际上是两种不同产品的加权平均。

对预算的影响

过渡期间,应按混合后的成本做规划,而不是按宣传标题上的数字。如果 20% 的调用降级到旧模型,你的实际输入单价就不是每百万 $4.00 — 而是混合比例决定的那个值。同样的逻辑也适用于宣传中的节省:“便宜 40%”是典型工作负载下的平均值,它假设 token 数量会减少;但如果更便宜却更老的模型恰好生成了更长的回答,这一假设就可能不成立。

需要坚持的规则

  1. 绝不基于别名建模。凡是你要做预算或评测的内容,都固定到带日期的模型 ID。
  2. 每个请求都记录解析后的模型。如果你以后可能重跑评测,这一点不可妥协。
  3. 过渡窗口结束后重新建立基线。通常持续数周而非数个季度,但请予以确认。
  4. 把过渡期当作混合来定价。向服务商询问预期的分配比例,或自行测量。

结论

降价和静默降级可能在同一个下午出现。降价是标题,降级则是那条悄悄让上个月预测失效的脚注。记录解析后的模型,固定带日期的 ID,并按混合结果定价。

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com