跳至正文

Claude Haiku 5.5 与 100k token 价格门槛

更新于 October 8, 2026 · 首次发布 October 8, 2026

快速结论: Claude Haiku 5.5 的标价取决于提示词长度。Anthropic 于 2026 年 10 月 7 日发布了该模型,面向分类、摘要和子智能体任务等高吞吐量工作。它 1M token 的上下文窗口并不意味着所有这些 token 都按短提示词单价计费:超过 100,000 token 的提示词会进入更高的价格档位。这使得请求规模成为预算决策,对于不断累积文档和工具结果的智能体尤其如此。...

Claude Haiku 5.5 的标价取决于提示词长度。Anthropic 于 2026 年 10 月 7 日发布了该模型,面向分类、摘要和子智能体任务等高吞吐量工作。它 1M token 的上下文窗口并不意味着所有这些 token 都按短提示词单价计费:超过 100,000 token 的提示词会进入更高的价格档位。这使得请求规模成为预算决策,对于不断累积文档和工具结果的智能体尤其如此。

价目表分两档

以下为 Anthropic 公布的 Claude API 标准价格,单位为美元每百万 token,核对日期为 10 月 8 日。门槛划分为提示词最多 100,000 token 与超过 100,000 token;这并不是只对超出门槛的部分 token 收取的价格。在用于预测之前,请查看实时定价文档。

token 类别 提示词最多 100k 提示词超过 100k
未缓存输入 $0.10 $0.50
输出 $0.50 $2.50
5 分钟缓存写入 $0.125 $0.625
1 小时缓存写入 $0.20 $1.00
缓存读取 $0.01 $0.05

门槛以上,每项 token 单价都高出五倍。这并不意味着每个应用的账单都会涨五倍:大多数调用可能仍然很短,而输出量、缓存、工具、批处理、重试以及任务成功率都会影响总支出。缓存的上下文仍然占用提示词长度;缓存命中并不会让一个 120k token 的请求变成短提示词。

单次请求上门槛的样子

以两个示例调用为例,均不使用缓存,也不单独计费工具,各生成 1,000 个输出 token。99,000 token 的提示词按短提示词单价计算,输入加输出约为 $0.0104。101,000 token 的提示词按长提示词单价计算,约为 $0.0530。输入只多出 2,000 token,成本却约为五倍。该示例将输出固定,以单独呈现定价门槛的影响,并非实测的生产节省。真实提示词还包括系统指令、对话历史、工具 schema 和工具结果。

迁移前重新计算

Anthropic 的迁移说明指出,同一段文本在 Haiku 5.5 上产生的 token 比 Haiku 4.5 大约多 30%,具体因内容而异。一个按旧 token 计数看起来远低于 100k 的提示词,可能会跨过新的门槛。不要把所有旧计数乘以 1.3 就当作账单预测;请用 claude-haiku-5-5 对有代表性的请求重新计数。

Anthropic 的 token 计数端点可以在发送生成请求之前,接收结构化消息、系统提示词和受支持的客户端工具。请针对目标模型计数,然后在响应之后记录实际用量。预检计数只是估算,可能与实际计费的输入略有不同;部分服务端工具以及 URL/文件块不受计数器支持。对于这些路径,请依据观测到的请求用量,并在门槛附近保留安全余量。

子智能体的提示词预算规则

  1. 测量分布。按工作负载、模型 ID 和任务结果记录 Haiku 5.5 的提示词 token 数。关注有多少调用聚集在 100k 附近或超过它,而不只看平均值。
  2. 在门槛之前发出警告。在智能体编排器中标记接近门槛的请求。警告线应作为你自己的运营余量,而不是 Anthropic 的价格规则。
  3. 削减原因。在质量测试允许的前提下,去除重复的检索片段,限制工具结果的大小,或压缩过期的历史记录。不要为了节省 token 而丢弃智能体所需的证据。
  4. 比较长尾。对于无法避免的长提示词,在相同任务上测试 Haiku 的较高档位与另一条路由。比较的是每个被接受结果的成本、延迟和回退频率,而不只是标价。
  5. 与账单核对。按适用档位计算实际的输入、输出、缓存读取和写入,并计入工具和重试。复核服务商或云平台的费率以及任何合同折扣。

在 100k 以上,Haiku 5.5 仍可能是最佳选择,但这应当是一项经过测量的路由决策。关键的控制手段是知道哪些请求会越过门槛,以及原因。

团队常问的问题

更高的价格只适用于超过 100k 的 token 吗?

不是。Anthropic 将 Haiku 5.5 描述为按提示词长度定价:超过 100,000 token 的提示词,该请求按较高的公布费率计费。

提示词缓存能让长请求留在较便宜的档位吗?

不能。复用的 token 可以获得缓存读取费率,但缓存的上下文仍然占用提示词长度。检查门槛时,请计入完整的提示词。

30% 的分词器增长是确定的吗?

不是。Anthropic 表示,相同文本在 Haiku 5.5 上的 token 数比 Haiku 4.5 大约多 30%,具体取决于内容。请在目标模型上计算你自己的提示词。

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com