Claude Fable 5.1 成本模型
更新于 September 1, 2026 · 首次发布 September 1, 2026
Claude Fable 5.1(claude-fable-5-1)的定价为每百万输入 Token $10,每百万输出 Token $50。Opus 5 则是 $5 和 $25。只看这四个数字,Fable 就像是一个统一的 2× 溢价。但这个判断是错的。缓存输入的价格朝相反的方向变化,而对于生产工作负载来说,大部分 Token 通常都在缓存里。
真正重要的四个价格
模型的价格不是一个数字。Fable 5.1 对五种不同的 Token 类型计费,而标题上的价格只涵盖其中两种。
| Token 类型 | Fable 5.1 | Opus 5 |
|---|---|---|
| 输入(未缓存) | $10.00 / 百万 Token | $5.00 / 百万 Token |
| 输出 | $50.00 / 百万 Token | $25.00 / 百万 Token |
| 缓存写入(5 分钟) | $12.50 / 百万 Token | $6.25 / 百万 Token |
| 缓存写入(1 小时) | $20.00 / 百万 Token | $10.00 / 百万 Token |
| 缓存读取 | $0.25 / 百万 Token | $0.50 / 百万 Token |
缓存读取是个例外。它只是 Fable 自身标准输入价格的 2.5%,而同样一个缓存 Token 在 Opus 5 上的成本是它的两倍。其他每一行都是 2×,只有这一行是 0.5×。
这对真实工作负载意味着什么
设想一个智能体,它的系统提示、工具模式和检索上下文共 100,000 个 Token,在一个会话中反复使用。冷调用时,这段前缀在 Fable 上花费 $1.00,在 Opus 5 上花费 $0.50。热调用时,它在 Fable 上是 $0.025,在 Opus 5 上是 $0.05。同样的提示,原本贵两倍的服务商现在只要一半的价格,唯一的变化是前缀是否命中了缓存。
因此,盈亏平衡点取决于缓存命中率,而不是对模型的偏好。当输入 Token 中由缓存提供的比例低于约 50% 时,Fable 的输入溢价占主导,按前缀计算 Opus 5 更便宜。超过这个比例后,Fable 的缓存价格就会领先,并且差距越拉越大。无论哪种情况,输出 Token 都保持 2×,这就是为什么第二个杠杆是输出长度,而不是模型选择。
输出是没有上限的一侧
Fable 5.1 支持 1M Token 的上下文窗口,单次响应最多可输出 128K 个输出 Token。按每百万 $50 计算,一次 128K 的响应就是 $6.40 的输出。这个模型始终开启扩展思考,无法关闭,旧的 budget_tokens 参数会被以 400 错误拒绝。取而代之的是从低到最大的 effort 设置。它现在是一个成本旋钮,应当与模型选择一起放进路由策略里,而不是放在没人会重新审视的应用默认值中。
原始推理内容从不返回,因此你的遥测无法从响应文本中还原思考成本。你必须从每次调用的 usage 块中读取并存储它。这个模型也没有优先层级,所以延迟无法购买,容量规划只能靠你自己在并发和排队上完成。
在导入流量之前应该监控什么
有三个字段决定 Fable 5.1 对你来说是便宜还是昂贵,而它们都不会出现在价格表上。
- 按功能划分的缓存命中率。不是账户级别的平均值。一个命中率 90% 的聊天界面和一个 0% 的批处理任务相互抵消,得出一个毫无意义的 45%。
- 缓存写入放大。1 小时写入的成本是标准输入的 2×。如果一段前缀被重写的次数多于被读取的次数,那么无论哪种 TTL 都是净亏损。
- 每个成功任务的输出 Token 数。2× 的输出溢价只有在需要更少尝试次数时才合理。应衡量每个成功任务的成本,而不是每次调用的成本。
然后,将当前模型的对比作为一次差异分解来进行,把价格、用量和组合分开看。一个列表价格是两倍、缓存价格是一半的模型,会表现为两个方向相反的巨大变动,而平均值会把两者都隐藏起来。
相关阅读
相关文章
想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →