Opus 5.5 fast mode经济学

Updated September 22, 2026 · first published September 22, 2026

Claude Opus 5.5有两份价单。标准价格是每百万输入token $4,每百万输出token $20。Fast mode是$8和$40,恰好是两倍,输出速度最高可达2.5×。模型完全相同。额外的费用只是换取时间,所以唯一的问题是谁的时间。

溢价购买的是什么

假设一个步骤产生5000个输出token。按标准费率,输出成本是$0.10。Fast mode下是$0.20。如果该步骤在标准速度下耗时60秒,2.5倍加速可减少到约24秒。你多花$0.10节省36秒。

这相当于每减少一小时等待时间花费约$10。步骤长度不会改变比例,因为额外成本和节省时间都随输出token增加。这取决于你的标准模式速度:本例假设约每秒83个输出token,请代入你自己的数字。输入也会翻倍,所以前缀密集的步骤每秒节省的成本会略微增加。

划算的情况

纯粹浪费的情况

按Anthropic的说法,标准Opus 5.5已比Opus 5快约30%。一些在Opus 5上会为fast mode辩护的延迟投诉可能仅通过升级就能解决。在为更快速度付费前,先衡量标准速度。

需要实施的控制措施

  1. 让fast mode成为明确的逐路线决策。 不应该是全局默认值,也不应该是某个工程师激活后就遗忘的开关。
  2. 按模式标记支出。 以单价两倍计价的fast mode请求在仅按模型分组的仪表板上看起来就像普通请求。
  3. 对输出token的fast mode占比设置警报。 如果在没人等待的路线上增加,说明被激活了不应该被激活的东西。
  4. 将努力和速度一起计预算。 最大努力会成倍增加token计数,fast mode会让每个token价格翻倍。这是运行模型成本最高的方式。

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research