Opus 5.5的努力水平才是真实价格

Updated September 22, 2026 · first published September 22, 2026

Claude Opus 5.5的价格是输入令牌每百万$4,输出令牌每百万$20。这比Opus 5便宜20%。价目表只是成本故事较小的一半。较大的一半是effort设置,它决定了模型在回答前思考花费多少个令牌。

一个模型,五种价格

Opus 5.5从lowmediumhighxhighmax提供努力水平。每个级别是相同的模型,具有相同的令牌单价,但生成令牌数量相差很大。The Decoder报告的独立基准测试发现,五个级别中的四个位于成本-性能帕累托边界上。它还发现,在最大努力下Opus 5.5每个任务使用约119,000个输出令牌,远超竞争模型在最高设置下的使用量。

按每百万 20 美元计算,119,200 个输出 token 在不计输入的情况下就是每任务 2.38 美元。在 medium 档,Artificial Analysis 实测输出 25,700 个 token,即 0.51 美元。计入输入后,max 每任务 5.98 美元,medium 1.34 美元:仅一个请求参数,就让同一模型的每任务成本相差约 4.5 倍。

基于 Artificial Analysis Intelligence Index v4.3.2(十项评测)的实测数据,读取于 2026 年 9 月 22 日。所有行使用同一套基准,可直接比较。

模型与 effortIntelligence Index每任务成本每任务输出 token是否在成本–性能前沿
Opus 5.5 · low42.3$0.5510,200
Opus 5.5 · medium51.2$1.3425,700
Opus 5.5 · high53.6$1.8235,600
Opus 5.5 · xhigh56.0$3.4665,700
Opus 5.5 · max57.6$5.98119,200
Opus 5 · high (参考)48.1$3.6146,200

来源:Artificial Analysis。位于前沿是指 GPT-6 Sol、GPT-6 Astra、Opus 5、Opus 5.5、Fable 5.1 的任何设置都无法以更低成本拿到更高分。Opus 5.5 low 不在前沿上,因为 GPT-6 Sol 的 xhigh 以 0.53 美元拿到 44.1 分。从 xhigh 升到 max,成本增加 73%,得分只多 1.6 分。

中等是Anthropic进行基准测试的设置

Anthropic的主要比较是在默认努力(中等)下进行的。它表示Opus 5.5在中等努力下在知识工作上的性能超过最大努力下的GPT-6 Astra,成本仅为其五分之一。因此,Anthropic自身对该模型的论证是建立在中等基础上的,而最大是例外。一个为了"保险起见"在所有地方都设置最大努力的团队,会为启动基准测试不需要的令牌付费。

如何无需猜测地设置努力水平

  1. 默认设置为中等。使其成为代码中的显式值,而不是可能会在你下方改变的SDK默认值。
  2. 按路由提高努力水平,而不是全局提高。困难的调试、长期规划和最终审查步骤可以证明高等或最大是合理的。分类、提取和常规编辑很少需要。
  3. 每个请求都记录努力水平。不记录的话就无法解释每个请求的成本。支出尖峰配合平稳的请求计数通常表示努力水平改变。
  4. 在相同的重新执行任务上比较努力水平。在每个级别上记录成功率和每个完成任务的输出令牌,当成功停止改进时停止提高努力水平。
  5. 在产品允许的地方限制输出。最大令牌限制限制了最坏的情况。在最大努力下,该限制是避免单个失控任务和多美元请求之间的唯一保障。

从每百万$25降至$20可节省20%。将工作负载从最大努力改为中等努力可节省更多。将努力视为预算项目,就像其他任何项目一样进行所有权和审查。

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research