Opus 5.5的努力水平才是真实价格
Updated September 22, 2026 · first published September 22, 2026
Claude Opus 5.5的价格是输入令牌每百万$4,输出令牌每百万$20。这比Opus 5便宜20%。价目表只是成本故事较小的一半。较大的一半是effort设置,它决定了模型在回答前思考花费多少个令牌。
一个模型,五种价格
Opus 5.5从low到medium、high、xhigh和max提供努力水平。每个级别是相同的模型,具有相同的令牌单价,但生成令牌数量相差很大。The Decoder报告的独立基准测试发现,五个级别中的四个位于成本-性能帕累托边界上。它还发现,在最大努力下Opus 5.5每个任务使用约119,000个输出令牌,远超竞争模型在最高设置下的使用量。
按每百万 20 美元计算,119,200 个输出 token 在不计输入的情况下就是每任务 2.38 美元。在 medium 档,Artificial Analysis 实测输出 25,700 个 token,即 0.51 美元。计入输入后,max 每任务 5.98 美元,medium 1.34 美元:仅一个请求参数,就让同一模型的每任务成本相差约 4.5 倍。
基于 Artificial Analysis Intelligence Index v4.3.2(十项评测)的实测数据,读取于 2026 年 9 月 22 日。所有行使用同一套基准,可直接比较。
| 模型与 effort | Intelligence Index | 每任务成本 | 每任务输出 token | 是否在成本–性能前沿 |
|---|---|---|---|---|
| Opus 5.5 · low | 42.3 | $0.55 | 10,200 | 否 |
| Opus 5.5 · medium | 51.2 | $1.34 | 25,700 | 是 |
| Opus 5.5 · high | 53.6 | $1.82 | 35,600 | 是 |
| Opus 5.5 · xhigh | 56.0 | $3.46 | 65,700 | 是 |
| Opus 5.5 · max | 57.6 | $5.98 | 119,200 | 是 |
| Opus 5 · high (参考) | 48.1 | $3.61 | 46,200 | 否 |
来源:Artificial Analysis。位于前沿是指 GPT-6 Sol、GPT-6 Astra、Opus 5、Opus 5.5、Fable 5.1 的任何设置都无法以更低成本拿到更高分。Opus 5.5 low 不在前沿上,因为 GPT-6 Sol 的 xhigh 以 0.53 美元拿到 44.1 分。从 xhigh 升到 max,成本增加 73%,得分只多 1.6 分。
中等是Anthropic进行基准测试的设置
Anthropic的主要比较是在默认努力(中等)下进行的。它表示Opus 5.5在中等努力下在知识工作上的性能超过最大努力下的GPT-6 Astra,成本仅为其五分之一。因此,Anthropic自身对该模型的论证是建立在中等基础上的,而最大是例外。一个为了"保险起见"在所有地方都设置最大努力的团队,会为启动基准测试不需要的令牌付费。
如何无需猜测地设置努力水平
- 默认设置为中等。使其成为代码中的显式值,而不是可能会在你下方改变的SDK默认值。
- 按路由提高努力水平,而不是全局提高。困难的调试、长期规划和最终审查步骤可以证明高等或最大是合理的。分类、提取和常规编辑很少需要。
- 每个请求都记录努力水平。不记录的话就无法解释每个请求的成本。支出尖峰配合平稳的请求计数通常表示努力水平改变。
- 在相同的重新执行任务上比较努力水平。在每个级别上记录成功率和每个完成任务的输出令牌,当成功停止改进时停止提高努力水平。
- 在产品允许的地方限制输出。最大令牌限制限制了最坏的情况。在最大努力下,该限制是避免单个失控任务和多美元请求之间的唯一保障。
从每百万$25降至$20可节省20%。将工作负载从最大努力改为中等努力可节省更多。将努力视为预算项目,就像其他任何项目一样进行所有权和审查。
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →