跳至正文

Ox Alpha 就是 GLM-5.3

更新于 September 1, 2026 · 首次发布 September 1, 2026

快速结论: 2026 年 8 月 20 日至 26 日,OpenRouter 上一个标为 stealth/ox-alpha 的模型免费提供服务。之后确认它是 GLM-5.3-Flash:总参数 320 billion、激活参数 18 billion,采用线性与稀疏混合注意力,原生支持文本、图像和视频输入,上下文窗口 1,048,576 个 token,最大输出 131K,权重采用 MIT...

2026 年 8 月 20 日至 26 日,OpenRouter 上一个标为 stealth/ox-alpha 的模型免费提供服务。之后确认它是 GLM-5.3-Flash:总参数 320 billion、激活参数 18 billion,采用线性与稀疏混合注意力,原生支持文本、图像和视频输入,上下文窗口 1,048,576 个 token,最大输出 131K,权重采用 MIT 许可。

使用量并不小。上线三天内,OpenCode 报告处理了约 16 万亿 token,独立用户 221,000 人,会话超过 500 万次,并跻身近期使用量第二位。这是生产流量,而非评测流量,而且六天内分文未收。

免费是一种费率,而非缺席

免费隐身端点的财务问题在于,大多数成本遥测把 $0 的行当作没有这一行。那一周被路由到 Ox Alpha 的请求在用量面板中显示为零成本,因此不计入任何支出预测、预算告警或按功能划分的单位经济视图。窗口关闭、模型改名、开始计费之后,同样的流量会以一次没人建模过的阶跃式增长重新出现。

对策是给每一次调用都计算影子价格,包括免费调用。照常记录 token 数,再乘以你本来会使用的模型的标价。这样面板就能显示这次促销每月值多少钱,以及活动结束当天账单会变成多少。16 万亿 token 按典型 flash 级别费率计算,绝不是可以忽略的舍入误差。

这个费率已经不再是假设。GLM-5.3-Flash 现在的标价是每百万输入 token 0.15 美元、每百万输出 token 0.50 美元。16 万亿输入 token 按此费率约为 $2.4 million — 即六天免费 token 的价值,也是这些流量若继续保持不变时将出现的阶跃幅度。

需要检查的三类风险

风险需要问的问题控制手段
费率悬崖明天按标价计算,这些流量要花多少钱?对免费端点使用影子定价,并设置同样的预算告警。
身份漂移本周别名背后是哪个模型?固定模型 ID;切勿在没有备用方案的情况下将生产流量路由到隐身别名。
质量耦合提示词是否针对一个你无法长期保留的模型做了调优?在窗口结束前,针对指定的替代模型运行评测。

MIT 权重改变了自建与购买的权衡

身份揭晓还有第二层意义。GLM-5.3-Flash 采用 MIT 许可,这意味着自托管选项是现实可行的,而不只是理论上的。总参数 320 billion、激活参数 18 billion,服务成本更接近一个中等规模的稠密模型,而非标题数字所暗示的水平,但前提是利用率长期保持在较高水平。当 GPU 利用率低于约 40–50% 时,按 token 计费的 API 通常仍然更划算,因为闲置加速卡照常按满额计费,而闲置的 API 调用不产生费用。

因此,决策的关键不是开放权重还是 API,而是一个利用率阈值。请测量整整一周(包括夜间和周末)的持续每秒 token 吞吐量,然后再将预留容量报价与相同用量按 API 标价计算的结果进行比较。自托管一栏中要计入部署服务、评测和升级的工程时间,这往往是自建方案最容易遗漏的一项。

下一个隐身模型出现时该怎么办

把每个免费窗口都视为与一个不具名交易方签订的定期合同。务必对模型进行充分评测,免费 token 是运行评测套件的一种廉价方式。但只有在有备用方案的前提下,才把生产流量路由到该模型,在仪表盘中保留影子价格,并把窗口结束日期记录为一个预测事件。这个模型很优秀,价格为零;两者之中只有一个是持久的。

相关阅读

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com