跳至正文

开放权重模型的定价

更新于 September 1, 2026 · 首次发布 September 1, 2026

快速结论: Qwen3.8-Flash-Next 于 2026 年 8 月 26 日以 Qwen4 架构的开放权重预览版发布:约 6B 激活参数,原生上下文 262,144 个 token,并且未公布托管定价。这种组合打破了常规比较方式。每个闭源模型都会给出一个每百万 token 的价格;而开放权重发布只给你一个检查点,价格要由你自己算出来。这个数字并不难算。只是大多数团队从来不算,而是把 $0 的下载与...

Qwen3.8-Flash-Next 于 2026 年 8 月 26 日以 Qwen4 架构的开放权重预览版发布:约 6B 激活参数,原生上下文 262,144 个 token,并且未公布托管定价。这种组合打破了常规比较方式。每个闭源模型都会给出一个每百万 token 的价格;而开放权重发布只给你一个检查点,价格要由你自己算出来。

这个数字并不难算。只是大多数团队从来不算,而是把 $0 的下载与 $3.00/MTok 的 API 价格做对比,然后得出下载更便宜的结论。也许确实如此,但应由算术来决定,而这套算术恰好有一项常被忽略的成本项。

公式

每百万 token 的成本,等于实例的每小时价格除以该实例一小时内生成的 token 数:

cost per MTok = hourly_price / (tokens_per_second * 3600) * 1,000,000

按每小时 $2.00、实测每秒 1,500 个 token 计算,即 2.00 / 5,400,000 * 1,000,000 = 每百万 token $0.37。与标价为每百万输出 token $3.00 的托管模型相比,自托管看起来能节省 8 倍。但这个数字也是错的,因为它假设你为之付费的每一秒 GPU 都在忙碌。

大家都会忘记的一项:利用率

你租下的是一个小时,但实际只用了其中一部分。用这部分比例去除:

利用率每百万 token 的有效成本
100%$0.37
60%$0.62
30%$1.23
10%$3.70

当利用率为 10% 时,自托管模型的成本已经高于它本来要替代的托管 API。大多数首次部署的利用率介于 10% 到 30% 之间,因为流量是突发性的,而实例却按峰值配置。节省确实存在,但它节省的是利用率,而不是权重本身的费用。

还有哪些应计入这个数字

检查点的存储与出站流量费用。实例启动到模型就绪之间的空闲时间。在大上下文模型上,加载需要数分钟,而这些时间全部都要付费。冗余,如果工作负载需要多个实例才能在节点故障时存活。以及工程时间,它不按小时计费,却是第一年最大的一项支出。

上述这些都不是反对自托管的理由,它们只说明:在没有做除法之前,不应把免费下载与按 token 计费的费率直接对比。

承诺之前先测量

用你真正会租用的实例运行模型,使用你自己的提示词形态和上下文长度,并记录并发状态下的每秒 token 数,而不是模型卡上的单流数字。然后根据你真实的每小时流量曲线计算利用率。两个数字、一次除法,决策自然就出来了。

长上下文是问题最突出的地方。262K token 的上下文首先是一笔内存占用,然后才是一项功能:它决定了实例规格,而实例规格又决定了公式顶端的每小时价格。应按你实际发送的上下文定价,而不是按模型所支持的上下文定价。

相关阅读

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com