Opus 5.5 fast mode经济学
Updated September 22, 2026 · first published September 22, 2026
Claude Opus 5.5有两份价单。标准价格是每百万输入token $4,每百万输出token $20。Fast mode是$8和$40,恰好是两倍,输出速度最高可达2.5×。模型完全相同。额外的费用只是换取时间,所以唯一的问题是谁的时间。
溢价购买的是什么
假设一个步骤产生5000个输出token。按标准费率,输出成本是$0.10。Fast mode下是$0.20。如果该步骤在标准速度下耗时60秒,2.5倍加速可减少到约24秒。你多花$0.10节省36秒。
这相当于每减少一小时等待时间花费约$10。步骤长度不会改变比例,因为额外成本和节省时间都随输出token增加。这取决于你的标准模式速度:本例假设约每秒83个输出token,请代入你自己的数字。输入也会翻倍,所以前缀密集的步骤每秒节省的成本会略微增加。
划算的情况
- 一个在等待交互式代码编写代理的开发者。 按每小时等待时间$10计,fast mode的成本远低于领工资的任何人的时间成本。
- 客户面向的回答,其中延迟影响转化率。 将速度提升与用户流失对比,而非与token账单。
- 事故响应,每一分钟都有成本。
纯粹浪费的情况
- 后台代理、夜间任务和批处理管道。 没人等待,所以额外支出毫无用处。
- 评估和重放。 这些工作负载正好是那种会成倍增加token计数且按计划运行的。
- 并行运行的子代理。 墙上时间由最慢的分支和编排器决定,不是由每个调用。
按Anthropic的说法,标准Opus 5.5已比Opus 5快约30%。一些在Opus 5上会为fast mode辩护的延迟投诉可能仅通过升级就能解决。在为更快速度付费前,先衡量标准速度。
需要实施的控制措施
- 让fast mode成为明确的逐路线决策。 不应该是全局默认值,也不应该是某个工程师激活后就遗忘的开关。
- 按模式标记支出。 以单价两倍计价的fast mode请求在仅按模型分组的仪表板上看起来就像普通请求。
- 对输出token的fast mode占比设置警报。 如果在没人等待的路线上增加,说明被激活了不应该被激活的东西。
- 将努力和速度一起计预算。 最大努力会成倍增加token计数,fast mode会让每个token价格翻倍。这是运行模型成本最高的方式。
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →