静默模型降级与成本模型
更新于 September 27, 2026 · 首次发布 September 27, 2026
2026 年 9 月 23 日,r/GroundTruthAINews 上的一个帖子指出,Anthropic 的 Opus 5.5 发布说明里埋着一条脚注:一次 Opus 5.5 请求可能由 Opus 4.8 响应。当天下午,Anthropic 和 OpenAI 同时宣布了降价。两家实验室卖的是同一个理念:保持能力,大幅降低支出。对 FinOps 来说,重要的是那条脚注。
实际发生了什么
Claude Opus 5.5 以每百万 token $4/$20 的价格发布,比 Opus 5 便宜约 20%,缓存读取降低 60%,至 $0.20。Anthropic 表示,每个任务使用的 token 更少,输出速度快 30%,使典型工作负载的成本降低约 40%。大约 90 分钟后,OpenAI 发布了 GPT-6 Sol,价格为 $2/$10,Luna 为 $0.10/$0.50,均为 GPT-5.6 价格的一半。
这一时期的每篇发布文章都带有同类脚注:你调用的端点是一个别名,而在过渡窗口期内,该别名会在多个模型版本之间做负载均衡。这是常规的容量管理做法。但它也是成本建模的一个问题。
为什么它会打乱数字
- 单任务成本发生漂移。你的预测假定使用 Opus 5.5 的输出定价。如果一部分调用落到了 4.8 上,单价和 token 数量都会变化,而且方向相反。
- 评测衡量的是混合结果。在过渡窗口期运行的评测套件,得到的是多个版本的混合得分。这个分数之后无法复现。
- 降价效果被错误归因。如果本应节省 40% 的成本只体现为 15%,差距通常来自版本混用,而不是优化出了问题。
- 延迟基线过时。4.8 不如 5.5 快。你在过渡期间采集的任何 p50 都不是稳定状态下的 p50。
如何检测这种切换
所有主流服务商都会在响应体中返回实际解析后的模型。把它记录下来。一个字段,四行代码:
resolved = response.model # e.g. "claude-opus-4-8-20260115"
assert resolved.startswith(EXPECTED_PREFIX) or resolved in ALLOWED_FALLBACKS然后按实际解析的模型而非你请求的模型,拆分每一项成本指标。一旦某个分组开始漂移,答案就出来了:别名在混用版本,你的单任务成本实际上是两种不同产品的加权平均。
对预算的影响
过渡期间,应按混合后的成本做规划,而不是按宣传标题上的数字。如果 20% 的调用降级到旧模型,你的实际输入单价就不是每百万 $4.00 — 而是混合比例决定的那个值。同样的逻辑也适用于宣传中的节省:“便宜 40%”是典型工作负载下的平均值,它假设 token 数量会减少;但如果更便宜却更老的模型恰好生成了更长的回答,这一假设就可能不成立。
需要坚持的规则
- 绝不基于别名建模。凡是你要做预算或评测的内容,都固定到带日期的模型 ID。
- 每个请求都记录解析后的模型。如果你以后可能重跑评测,这一点不可妥协。
- 过渡窗口结束后重新建立基线。通常持续数周而非数个季度,但请予以确认。
- 把过渡期当作混合来定价。向服务商询问预期的分配比例,或自行测量。
结论
降价和静默降级可能在同一个下午出现。降价是标题,降级则是那条悄悄让上个月预测失效的脚注。记录解析后的模型,固定带日期的 ID,并按混合结果定价。
相关文章
想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →