Quick answer: 大模型在线推理是服务交付成本(Cost of Goods...

AI功能上线前必须测算的毛利率模型

Updated September 2, 2026 · first published September 2, 2026

大模型在线推理是服务交付成本(Cost of Goods Sold),绝非研发资本化开支。它随着客户的每次真实操作持续触发,与业务用量严格线性绑定,并最终体现在生产基础设施账单中。如果直到功能上线前都将其计入研发成本,那么真正的毛利率数据就只能等首个完整账单周期揭晓——而那是发现利润塌陷最糟糕的时机。

在上线前而非上线后埋点

在预发(Staging)环境中,必须将每次模型调用打上租户账户、业务流以及最终交付结果的元数据标签,并回放高度拟真的真实流量,而非简单的虚构压测循环。你需要的是完整的统计分布:p50、p90与p99分位数下的单次成功任务成本,以及即使失败也必须付费的重试损耗比例。单一的平均值会彻底抹平那些击穿毛利的极端重度客户。

汇总为单租户月度成本

将单次成功任务成本乘以每个账户预期的月任务量,并加上无效重试的沉没损耗。将该测算值与订阅套餐价格直接对比。分别在用量中位数、第90百分位以及系统可承受的最重度极端账户三个切片进行核算。固定订阅价格模式往往在用量长尾处彻底失效,因为收入停滞时Token支出却在无上限膨胀。

四大关键成本动因

将测算指标落实为商业决策

在正式发布前,基于测算做出明确的商业或架构决策:在套餐中引入阶梯用量硬顶、增加基于用量的按需加价包、将默认模型降级为经济型并在复杂场景动态升级,或确立经管理层特批的阶段性毛利目标并设立复盘日期。

Related


Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →

Back to research