前沿模型的每任务真实成本

Updated September 22, 2026 · first published September 22, 2026

标价告诉你一个 token 多少钱,却不告诉你完成一个任务多少钱,因为不同模型完成同样的工作所用的 token 数相差很大。本页把 Claude Opus 5.5、Claude Opus 5、Claude Fable 5.1、GPT-6 Astra 和 GPT-6 Sol 在每个 effort 档位的实测每任务成本和质量得分并排列出。每个数字都有来源,没有任何估算。

简短结论:要达到 47.5 分及以下的任何得分,GPT-6 Sol 都是最便宜的。高于 47.5 分,每个档位都是 Opus 5.5 最便宜。GPT-6 Astra 在 low 以上的设置、Opus 5 和 Fable 5.1 的任何设置都不具成本效率:每一个都在得分和价格上同时输给 Sol 或 Opus 5.5 的某个设置。

方法

所有得分和成本均来自 Artificial Analysis Intelligence Index v4.3.2,查阅于 2026 年 9 月 22 日。该指数包含十项评测:AA-Briefcase、GDPval-AA、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience 和 AA-LCR。Artificial Analysis 通过各厂商 API 在每个 effort 档位运行每个模型,并记录按标价支付的金额。每任务成本就是每个任务的这笔支出,分为输入和输出。每一行都跑同一套评测,因此可以直接比较。

阅读数字之前有两点限制。第一,该指数只是一种任务组合。你的任务组合会改变成本,所以最后一节讲解如何测量你自己的成本。第二,不同指数版本的得分不可比较,不要把这些数字和更早发布的数字混用。

完整列表:26 个设置

每任务输出 token 是模型写出的 token,包括推理。Artificial Analysis 没有公布 GPT-6 Sol 中间四个设置的输入与输出拆分,因此这些单元格标为 n/a。

模型EffortIntelligence Index每任务成本输入成本输出成本每任务输出 token位于前沿
GPT-6 Solnone28.1$0.33$0.28$0.054,900
GPT-6 Sollow33.9$0.13n/an/a3,400
GPT-6 Solmedium (默认)39.8$0.25n/an/a6,500
GPT-6 Solhigh42.8$0.37n/an/a10,200
GPT-6 Solxhigh44.1$0.53n/an/a16,000
GPT-6 Solmax47.5$1.06$0.74$0.3131,200
GPT-6 Astralow45.8$0.82$0.60$0.224,400
GPT-6 Astramedium49.6$1.54$1.06$0.489,600
GPT-6 Astrahigh50.9$1.73$1.13$0.5911,800
GPT-6 Astraxhigh52.4$2.31$1.46$0.8516,900
GPT-6 Astramax52.7$3.26$1.90$1.3627,200
Claude Opus 5low39.4$1.10$0.73$0.3714,700
Claude Opus 5medium44.8$2.19$1.47$0.7229,000
Claude Opus 5high (默认)48.1$3.61$2.46$1.1646,200
Claude Opus 5xhigh49.7$4.88$3.36$1.5260,700
Claude Opus 5max50.8$5.86$4.05$1.8172,500
Claude Opus 5.5low42.3$0.55$0.35$0.2010,200
Claude Opus 5.5medium (默认)51.2$1.34$0.82$0.5125,700
Claude Opus 5.5high53.6$1.82$1.11$0.7135,600
Claude Opus 5.5xhigh56.0$3.46$2.15$1.3165,700
Claude Opus 5.5max57.6$5.98$3.60$2.38119,200
Claude Fable 5.1low46.8$2.37$1.30$1.0821,600
Claude Fable 5.1medium48.9$2.98$1.59$1.3927,900
Claude Fable 5.1high51.2$3.91$2.01$1.9038,100
Claude Fable 5.1xhigh53.2$5.98$2.96$3.0260,500
Claude Fable 5.1max53.4$7.63$3.73$3.9078,100

位于前沿是指本表中没有其他设置能以更少的钱得到更高的分数。

成本前沿

26 个设置中有 10 个位于前沿。按成本排序,如果只看价格,只有这些设置值得考虑。其余设置都是为相同或更低的得分付出更多。

设置Intelligence Index每任务成本每 1 万个任务
GPT-6 Sol · low33.9$0.13$1,300
GPT-6 Sol · medium39.8$0.25$2,500
GPT-6 Sol · high42.8$0.37$3,700
GPT-6 Sol · xhigh44.1$0.53$5,300
GPT-6 Astra · low45.8$0.82$8,200
GPT-6 Sol · max47.5$1.06$10,600
Claude Opus 5.5 · medium51.2$1.34$13,400
Claude Opus 5.5 · high53.6$1.82$18,200
Claude Opus 5.5 · xhigh56.0$3.46$34,600
Claude Opus 5.5 · max57.6$5.98$59,800

前沿分为两段。从 0.13 美元到 1.06 美元几乎全是 GPT-6 Sol,唯一的例外是 0.82 美元的 GPT-6 Astra low。从 1.34 美元往上只有 Opus 5.5。两段之间的差距很小:Opus 5.5 medium 比 Sol max 高 3.7 分,每任务只贵 0.28 美元。

同等或更高得分下的正面对比

每一组都比较一个较便宜的设置和一个得分相同或更低的较贵设置。

较便宜的设置较贵的设置得分差节省
Opus 5.5 medium: 51.2, $1.34Opus 5 high: 48.1, $3.61Opus 5.5+3.163%
Opus 5.5 medium: 51.2, $1.34Opus 5 max: 50.8, $5.86Opus 5.5+0.477%
Opus 5.5 medium: 51.2, $1.34Fable 5.1 high: 51.2, $3.91持平66%
Opus 5.5 high: 53.6, $1.82GPT-6 Astra max: 52.7, $3.26Opus 5.5+0.944%
Opus 5.5 high: 53.6, $1.82Fable 5.1 max: 53.4, $7.63Opus 5.5+0.276%
GPT-6 Sol max: 47.5, $1.06Opus 5 high: 48.1, $3.61Opus 5+0.671%

Opus 5 这一行对尚未迁移的团队很重要。Opus 5 默认使用 high。Opus 5.5 默认使用 medium,在该默认值下得分高 3.1 分,每任务成本低 63%。Anthropic 称 Opus 5.5 比 Opus 5 便宜 40%;在这个指数上实测的差距比这一说法更大。

钱花在哪里:输入,而不是输出

所有模型的输入都占每任务成本的大约一半到四分之三。Opus 5.5 medium 的 1.34 美元中有 0.82 美元是输入,即 61%。GPT-6 Astra max 为 58%,GPT-6 Sol max 为 70%,Fable 5.1 max 为 49%。智能体任务在每一步都会重新发送不断增长的上下文,因此输入支出随步数增长,而不只是随回答长度增长。

这就是为什么 GPT-6 Sol 不推理时反而比 low 更贵:0.33 美元对 0.13 美元,尽管它只写了 4,900 个输出 token。0.33 美元中有 0.28 美元是输入。可能的原因是步骤更多,每一步都重新发送上下文。关闭推理后如果智能体需要更多轮次,它并不会更便宜。

对你的账单来说,这意味着缓存和模型选择同样重要。Opus 5.5 和 GPT-6 Sol 的缓存输入都是每百万 token 0.20 美元。GPT-6 Astra 为 1.00 美元,Opus 5 为 0.50 美元。

token 用量与标价

GPT-6 Astra 是这里最省 token 的模型。在 max 档位它每任务只写 27,200 个输出 token,而 Opus 5.5 max 为 119,200 个。但 Astra 每百万收费 10 美元和 50 美元,是 Opus 5.5 费率的 2.5×。标价胜出:Opus 5.5 high 每任务 1.82 美元、得分 53.6,而 Astra max 为 3.26 美元、得分 52.7。

只有在 Opus 5.5 max 上,啰嗦才真正花钱。它的 119,200 个输出 token 在不计输入时就要 2.38 美元,整个任务要 5.98 美元。这换来了表中最高的 57.6 分,但成本是 medium 的 4.5×。

提高 effort 的边际收益递减

每一行显示提高一个 effort 档位能换来多少指数分,以及每任务的额外成本。

模型medium → highxhigh → max
GPT-6 Sol+48%换 +3.0 分+100%换 +3.4 分
GPT-6 Astra+12%换 +1.3 分+41%换 +0.3 分
Claude Opus 5+65%换 +3.3 分+20%换 +1.1 分
Claude Opus 5.5+36%换 +2.4 分+73%换 +1.6 分
Claude Fable 5.1+31%换 +2.3 分+28%换 +0.2 分

对 Fable 5.1 和 GPT-6 Astra 来说,max 几乎换不来什么:多花 28% 和 41%,只多 0.2 和 0.3 分。对 Opus 5.5 来说,升到 max 仍能多 1.6 分,但成本高 73%。只在你已实测额外分数会改变结果的任务上使用 max。

什么时候 GPT-6 Sol max 就够了

指数是平均值,Sol max 与 Opus 5.5 medium 之间的差距在各项评测中并不均匀。Artificial Analysis 的分项得分:

评测Opus 5.5 medium ($1.34)GPT-6 Sol max ($1.06)
Terminal-Bench 4.052.543.9
AutomationBench-AA61.261.6
GDPval-AA (Elo)15761487
AA-Briefcase (Elo)16421483
Humanity's Last Exam54.747.9
SciCode59.357.6
CritPt27.730.9
AA-LCR84.383.7

在 AutomationBench 和 CritPt 上,GPT-6 Sol 以每任务 1.06 美元对 1.34 美元持平或超过 Opus 5.5 medium。在 Terminal-Bench、知识工作类评测和 Humanity's Last Exam 上,Opus 5.5 大幅领先。工作流自动化可以跑在 Sol 上。终端和编程智能体以及文档密集的知识工作,才是 Opus 5.5 物有所值的地方。

厂商数据与独立数据

厂商数据和独立数据经常不一致,因为它们使用不同的测试框架和设置。Anthropic 公布 Opus 5.5 在 xhigh 下的 Terminal-Bench 4.0 成绩为 66.4%。Artificial Analysis 在相同 effort 下实测为 59.6%。

EffortOpus 5.5Fable 5.1
low31.3%40.4%
medium52.5%44.9%
high56.6%52.0%
xhigh59.6%55.1%
max59.6%52.0%

排名也会随指数而变。在 Vals AI Index 上,Fable 5.1 以 68.83% 排第一,GPT-6 Astra 以 66.61% 排第三,Opus 5.5 以 66.16% 排第四。那里没有按同一口径公布每任务成本,所以不影响上面的前沿。一个指数只是一种视角。

标价与一个重缓存任务

Digital Applied 在每个模型上计算了一个重缓存智能体任务的价格:8M 缓存读取 token、400K 未缓存输入、600K 缓存写入 token 和 300K 输出 token。结果与前沿一致,只是 GPT-6 Astra 多了一项额外惩罚。

模型输入 $/MTok输出 $/MTok缓存读取 $/MTok重缓存任务(Digital Applied)
GPT-6 Sol$2.00$10.00$0.20$6.90
Claude Opus 5.5$4.00$20.00$0.20$12.20
Claude Opus 5$5.00$25.00$0.50$17.25
Claude Fable 5.1$10.00$50.00$0.25$28.50
GPT-6 Astra (≤272K)$10.00$50.00$1.00$34.50
GPT-6 Astra (>272K)$20.00$75.00n/a$61.50

一旦输入超过 272K token,GPT-6 Astra 会对整个请求按每百万 20 美元和 75 美元计费。Opus 5.5 在整个 1M token 窗口内保持单一价格。Opus 5.5 的缓存写入在 5 分钟缓存下为每百万 5 美元,1 小时缓存为 8 美元;批处理按 50% 计费,快速模式价格翻倍。详情请见Claude Opus 5.5 成本模型Opus 5.5 快速模式的经济账

如何测量你自己的每任务成本

  1. 按任务而不是按请求记录 token:未缓存输入、缓存输入、缓存写入和输出,在任务的每一步上求和。
  2. 抽取几百个真实任务作为样本,在两三个候选设置上重跑,例如 Sol max、Opus 5.5 medium 和 Opus 5.5 high。
  3. 用生产环境中相同的检查给每个结果打分,并统计通过的任务数。
  4. 用总支出除以通过的任务数。每个成功任务的成本才是要比较的数字,因为便宜但更常失败的设置并不便宜。
  5. 选出达到质量门槛的最便宜设置,只把失败的任务交给更高的设置。
  6. 当价格或默认 effort 变化时,重新跑一遍。

effort 设置如何改变同一模型的账单,请见Opus 5.5 的 effort 档位才是真实价格

注意事项

来源

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research