前沿模型的每任务真实成本
Updated September 22, 2026 · first published September 22, 2026
标价告诉你一个 token 多少钱,却不告诉你完成一个任务多少钱,因为不同模型完成同样的工作所用的 token 数相差很大。本页把 Claude Opus 5.5、Claude Opus 5、Claude Fable 5.1、GPT-6 Astra 和 GPT-6 Sol 在每个 effort 档位的实测每任务成本和质量得分并排列出。每个数字都有来源,没有任何估算。
简短结论:要达到 47.5 分及以下的任何得分,GPT-6 Sol 都是最便宜的。高于 47.5 分,每个档位都是 Opus 5.5 最便宜。GPT-6 Astra 在 low 以上的设置、Opus 5 和 Fable 5.1 的任何设置都不具成本效率:每一个都在得分和价格上同时输给 Sol 或 Opus 5.5 的某个设置。
方法
所有得分和成本均来自 Artificial Analysis Intelligence Index v4.3.2,查阅于 2026 年 9 月 22 日。该指数包含十项评测:AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR。Artificial Analysis 通过各厂商 API 在每个 effort 档位运行每个模型,并记录按标价支付的金额。每任务成本就是每个任务的这笔支出,分为输入和输出。每一行都跑同一套评测,因此可以直接比较。
阅读数字之前有两点限制。第一,该指数只是一种任务组合。你的任务组合会改变成本,所以最后一节讲解如何测量你自己的成本。第二,不同指数版本的得分不可比较,不要把这些数字和更早发布的数字混用。
完整列表:26 个设置
每任务输出 token 是模型写出的 token,包括推理。Artificial Analysis 没有公布 GPT-6 Sol 中间四个设置的输入与输出拆分,因此这些单元格标为 n/a。
| 模型 | Effort | Intelligence Index | 每任务成本 | 输入成本 | 输出成本 | 每任务输出 token | 位于前沿 |
|---|---|---|---|---|---|---|---|
| GPT-6 Sol | none | 28.1 | $0.33 | $0.28 | $0.05 | 4,900 | 否 |
| GPT-6 Sol | low | 33.9 | $0.13 | n/a | n/a | 3,400 | 是 |
| GPT-6 Sol | medium (默认) | 39.8 | $0.25 | n/a | n/a | 6,500 | 是 |
| GPT-6 Sol | high | 42.8 | $0.37 | n/a | n/a | 10,200 | 是 |
| GPT-6 Sol | xhigh | 44.1 | $0.53 | n/a | n/a | 16,000 | 是 |
| GPT-6 Sol | max | 47.5 | $1.06 | $0.74 | $0.31 | 31,200 | 是 |
| GPT-6 Astra | low | 45.8 | $0.82 | $0.60 | $0.22 | 4,400 | 是 |
| GPT-6 Astra | medium | 49.6 | $1.54 | $1.06 | $0.48 | 9,600 | 否 |
| GPT-6 Astra | high | 50.9 | $1.73 | $1.13 | $0.59 | 11,800 | 否 |
| GPT-6 Astra | xhigh | 52.4 | $2.31 | $1.46 | $0.85 | 16,900 | 否 |
| GPT-6 Astra | max | 52.7 | $3.26 | $1.90 | $1.36 | 27,200 | 否 |
| Claude Opus 5 | low | 39.4 | $1.10 | $0.73 | $0.37 | 14,700 | 否 |
| Claude Opus 5 | medium | 44.8 | $2.19 | $1.47 | $0.72 | 29,000 | 否 |
| Claude Opus 5 | high (默认) | 48.1 | $3.61 | $2.46 | $1.16 | 46,200 | 否 |
| Claude Opus 5 | xhigh | 49.7 | $4.88 | $3.36 | $1.52 | 60,700 | 否 |
| Claude Opus 5 | max | 50.8 | $5.86 | $4.05 | $1.81 | 72,500 | 否 |
| Claude Opus 5.5 | low | 42.3 | $0.55 | $0.35 | $0.20 | 10,200 | 否 |
| Claude Opus 5.5 | medium (默认) | 51.2 | $1.34 | $0.82 | $0.51 | 25,700 | 是 |
| Claude Opus 5.5 | high | 53.6 | $1.82 | $1.11 | $0.71 | 35,600 | 是 |
| Claude Opus 5.5 | xhigh | 56.0 | $3.46 | $2.15 | $1.31 | 65,700 | 是 |
| Claude Opus 5.5 | max | 57.6 | $5.98 | $3.60 | $2.38 | 119,200 | 是 |
| Claude Fable 5.1 | low | 46.8 | $2.37 | $1.30 | $1.08 | 21,600 | 否 |
| Claude Fable 5.1 | medium | 48.9 | $2.98 | $1.59 | $1.39 | 27,900 | 否 |
| Claude Fable 5.1 | high | 51.2 | $3.91 | $2.01 | $1.90 | 38,100 | 否 |
| Claude Fable 5.1 | xhigh | 53.2 | $5.98 | $2.96 | $3.02 | 60,500 | 否 |
| Claude Fable 5.1 | max | 53.4 | $7.63 | $3.73 | $3.90 | 78,100 | 否 |
位于前沿是指本表中没有其他设置能以更少的钱得到更高的分数。
成本前沿
26 个设置中有 10 个位于前沿。按成本排序,如果只看价格,只有这些设置值得考虑。其余设置都是为相同或更低的得分付出更多。
| 设置 | Intelligence Index | 每任务成本 | 每 1 万个任务 |
|---|---|---|---|
| GPT-6 Sol · low | 33.9 | $0.13 | $1,300 |
| GPT-6 Sol · medium | 39.8 | $0.25 | $2,500 |
| GPT-6 Sol · high | 42.8 | $0.37 | $3,700 |
| GPT-6 Sol · xhigh | 44.1 | $0.53 | $5,300 |
| GPT-6 Astra · low | 45.8 | $0.82 | $8,200 |
| GPT-6 Sol · max | 47.5 | $1.06 | $10,600 |
| Claude Opus 5.5 · medium | 51.2 | $1.34 | $13,400 |
| Claude Opus 5.5 · high | 53.6 | $1.82 | $18,200 |
| Claude Opus 5.5 · xhigh | 56.0 | $3.46 | $34,600 |
| Claude Opus 5.5 · max | 57.6 | $5.98 | $59,800 |
前沿分为两段。从 0.13 美元到 1.06 美元几乎全是 GPT-6 Sol,唯一的例外是 0.82 美元的 GPT-6 Astra low。从 1.34 美元往上只有 Opus 5.5。两段之间的差距很小:Opus 5.5 medium 比 Sol max 高 3.7 分,每任务只贵 0.28 美元。
同等或更高得分下的正面对比
每一组都比较一个较便宜的设置和一个得分相同或更低的较贵设置。
| 较便宜的设置 | 较贵的设置 | 得分差 | 节省 |
|---|---|---|---|
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 high: 48.1, $3.61 | Opus 5.5+3.1 | 63% |
| Opus 5.5 medium: 51.2, $1.34 | Opus 5 max: 50.8, $5.86 | Opus 5.5+0.4 | 77% |
| Opus 5.5 medium: 51.2, $1.34 | Fable 5.1 high: 51.2, $3.91 | 持平 | 66% |
| Opus 5.5 high: 53.6, $1.82 | GPT-6 Astra max: 52.7, $3.26 | Opus 5.5+0.9 | 44% |
| Opus 5.5 high: 53.6, $1.82 | Fable 5.1 max: 53.4, $7.63 | Opus 5.5+0.2 | 76% |
| GPT-6 Sol max: 47.5, $1.06 | Opus 5 high: 48.1, $3.61 | Opus 5+0.6 | 71% |
Opus 5 这一行对尚未迁移的团队很重要。Opus 5 默认使用 high。Opus 5.5 默认使用 medium,在该默认值下得分高 3.1 分,每任务成本低 63%。Anthropic 称 Opus 5.5 比 Opus 5 便宜 40%;在这个指数上实测的差距比这一说法更大。
钱花在哪里:输入,而不是输出
所有模型的输入都占每任务成本的大约一半到四分之三。Opus 5.5 medium 的 1.34 美元中有 0.82 美元是输入,即 61%。GPT-6 Astra max 为 58%,GPT-6 Sol max 为 70%,Fable 5.1 max 为 49%。智能体任务在每一步都会重新发送不断增长的上下文,因此输入支出随步数增长,而不只是随回答长度增长。
这就是为什么 GPT-6 Sol 不推理时反而比 low 更贵:0.33 美元对 0.13 美元,尽管它只写了 4,900 个输出 token。0.33 美元中有 0.28 美元是输入。可能的原因是步骤更多,每一步都重新发送上下文。关闭推理后如果智能体需要更多轮次,它并不会更便宜。
对你的账单来说,这意味着缓存和模型选择同样重要。Opus 5.5 和 GPT-6 Sol 的缓存输入都是每百万 token 0.20 美元。GPT-6 Astra 为 1.00 美元,Opus 5 为 0.50 美元。
token 用量与标价
GPT-6 Astra 是这里最省 token 的模型。在 max 档位它每任务只写 27,200 个输出 token,而 Opus 5.5 max 为 119,200 个。但 Astra 每百万收费 10 美元和 50 美元,是 Opus 5.5 费率的 2.5×。标价胜出:Opus 5.5 high 每任务 1.82 美元、得分 53.6,而 Astra max 为 3.26 美元、得分 52.7。
只有在 Opus 5.5 max 上,啰嗦才真正花钱。它的 119,200 个输出 token 在不计输入时就要 2.38 美元,整个任务要 5.98 美元。这换来了表中最高的 57.6 分,但成本是 medium 的 4.5×。
提高 effort 的边际收益递减
每一行显示提高一个 effort 档位能换来多少指数分,以及每任务的额外成本。
| 模型 | medium → high | xhigh → max |
|---|---|---|
| GPT-6 Sol | +48%换 +3.0 分 | +100%换 +3.4 分 |
| GPT-6 Astra | +12%换 +1.3 分 | +41%换 +0.3 分 |
| Claude Opus 5 | +65%换 +3.3 分 | +20%换 +1.1 分 |
| Claude Opus 5.5 | +36%换 +2.4 分 | +73%换 +1.6 分 |
| Claude Fable 5.1 | +31%换 +2.3 分 | +28%换 +0.2 分 |
对 Fable 5.1 和 GPT-6 Astra 来说,max 几乎换不来什么:多花 28% 和 41%,只多 0.2 和 0.3 分。对 Opus 5.5 来说,升到 max 仍能多 1.6 分,但成本高 73%。只在你已实测额外分数会改变结果的任务上使用 max。
什么时候 GPT-6 Sol max 就够了
指数是平均值,Sol max 与 Opus 5.5 medium 之间的差距在各项评测中并不均匀。Artificial Analysis 的分项得分:
| 评测 | Opus 5.5 medium ($1.34) | GPT-6 Sol max ($1.06) |
|---|---|---|
| Terminal-Bench 4.0 | 52.5 | 43.9 |
| AutomationBench-AA | 61.2 | 61.6 |
| GDPval-AA (Elo) | 1576 | 1487 |
| AA-Briefcase (Elo) | 1642 | 1483 |
| Humanity's Last Exam | 54.7 | 47.9 |
| SciCode | 59.3 | 57.6 |
| CritPt | 27.7 | 30.9 |
| AA-LCR | 84.3 | 83.7 |
在 AutomationBench 和 CritPt 上,GPT-6 Sol 以每任务 1.06 美元对 1.34 美元持平或超过 Opus 5.5 medium。在 Terminal-Bench、知识工作类评测和 Humanity's Last Exam 上,Opus 5.5 大幅领先。工作流自动化可以跑在 Sol 上。终端和编程智能体以及文档密集的知识工作,才是 Opus 5.5 物有所值的地方。
厂商数据与独立数据
厂商数据和独立数据经常不一致,因为它们使用不同的测试框架和设置。Anthropic 公布 Opus 5.5 在 xhigh 下的 Terminal-Bench 4.0 成绩为 66.4%。Artificial Analysis 在相同 effort 下实测为 59.6%。
| Effort | Opus 5.5 | Fable 5.1 |
|---|---|---|
| low | 31.3% | 40.4% |
| medium | 52.5% | 44.9% |
| high | 56.6% | 52.0% |
| xhigh | 59.6% | 55.1% |
| max | 59.6% | 52.0% |
排名也会随指数而变。在 Vals AI Index 上,Fable 5.1 以 68.83% 排第一,GPT-6 Astra 以 66.61% 排第三,Opus 5.5 以 66.16% 排第四。那里没有按同一口径公布每任务成本,所以不影响上面的前沿。一个指数只是一种视角。
标价与一个重缓存任务
Digital Applied 在每个模型上计算了一个重缓存智能体任务的价格:8M 缓存读取 token、400K 未缓存输入、600K 缓存写入 token 和 300K 输出 token。结果与前沿一致,只是 GPT-6 Astra 多了一项额外惩罚。
| 模型 | 输入 $/MTok | 输出 $/MTok | 缓存读取 $/MTok | 重缓存任务(Digital Applied) |
|---|---|---|---|---|
| GPT-6 Sol | $2.00 | $10.00 | $0.20 | $6.90 |
| Claude Opus 5.5 | $4.00 | $20.00 | $0.20 | $12.20 |
| Claude Opus 5 | $5.00 | $25.00 | $0.50 | $17.25 |
| Claude Fable 5.1 | $10.00 | $50.00 | $0.25 | $28.50 |
| GPT-6 Astra (≤272K) | $10.00 | $50.00 | $1.00 | $34.50 |
| GPT-6 Astra (>272K) | $20.00 | $75.00 | n/a | $61.50 |
一旦输入超过 272K token,GPT-6 Astra 会对整个请求按每百万 20 美元和 75 美元计费。Opus 5.5 在整个 1M token 窗口内保持单一价格。Opus 5.5 的缓存写入在 5 分钟缓存下为每百万 5 美元,1 小时缓存为 8 美元;批处理按 50% 计费,快速模式价格翻倍。详情请见Claude Opus 5.5 成本模型和Opus 5.5 快速模式的经济账。
如何测量你自己的每任务成本
- 按任务而不是按请求记录 token:未缓存输入、缓存输入、缓存写入和输出,在任务的每一步上求和。
- 抽取几百个真实任务作为样本,在两三个候选设置上重跑,例如 Sol max、Opus 5.5 medium 和 Opus 5.5 high。
- 用生产环境中相同的检查给每个结果打分,并统计通过的任务数。
- 用总支出除以通过的任务数。每个成功任务的成本才是要比较的数字,因为便宜但更常失败的设置并不便宜。
- 选出达到质量门槛的最便宜设置,只把失败的任务交给更高的设置。
- 当价格或默认 effort 变化时,重新跑一遍。
effort 设置如何改变同一模型的账单,请见Opus 5.5 的 effort 档位才是真实价格。
注意事项
- 所有成本都是在 Artificial Analysis 任务组合上按 API 标价计算的。折扣、批处理价格和你自己的缓存都会改变它们。
- Artificial Analysis 将其 Opus 5.5 和 Fable 5.1 条目标为 Default Fallback。在把每一行都视为相同的 API 配置之前,请先查看其方法说明。
- 得分仅来自指数 v4.3.2。更早的版本使用不同的评测,不可比较。
- Digital Applied 的重缓存任务是一个示例负载,不是测量结果。
- 厂商调整价格或默认值时,数字也会变化。查阅日期为 2026 年 9 月 22 日。
来源
- Artificial Analysis Intelligence Index
- Artificial Analysis: Claude Opus 5.5
- Artificial Analysis: Claude Opus 5
- Artificial Analysis: Claude Fable 5.1
- Artificial Analysis: GPT-6 Astra
- Artificial Analysis: GPT-6 Sol
- Digital Applied: GPT-6 Sol vs Claude Opus 5.5 cost benchmarks
- Digital Applied: Claude Opus 5.5 vs GPT-6 Astra
- Digital Applied: Is Claude Fable 5.1 still worth it?
- Digital Applied: Claude Opus 5.5 launch pricing and benchmarks
- Digital Applied: Opus 5.5 vs Grok 4.7 vs Muse Spark 1.3 cost per task
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →