跳至正文

实时与音频 API 的单位经济学

更新于 September 1, 2026 · 首次发布 September 1, 2026

快速结论: 每一套为文本 LLM 设计的成本模型,放到语音上都会失效。文本按 token 计费,token 与信息量成正比。音频按时长计费,时长与时间成正比 — 包括所有没有任何有用内容发生的时间。你真正在为什么付费一次语音交互通常叠加三到四项计费:入站音频的语音转文字,模型调用本身(在端到端的语音实时 API 上按输入和输出音频的分钟数计费,而不是按...

每一套为文本 LLM 设计的成本模型,放到语音上都会失效。文本按 token 计费,token 与信息量成正比。音频按时长计费,时长与时间成正比 — 包括所有没有任何有用内容发生的时间。

你真正在为什么付费

一次语音交互通常叠加三到四项计费:入站音频的语音转文字,模型调用本身(在端到端的语音实时 API 上按输入和输出音频的分钟数计费,而不是按 token),若技术栈不是端到端的则还有回程的语音合成,以及通常单独计费的会话保持开启。

最后这一项是陷阱。用户在思考、阅读屏幕或暂时离开时,会话仍然开着,它就仍然是一个会话。在按分钟计费的表上,空白时段就是按全价计费的产品。

估算哪里出错

团队通常把语音成本建模为说话时长 × 单价,结果远低于实际。有四样东西被漏掉了。延迟与停顿会计费,却没有被建模。打断意味着生成并付了费的音频,而对方从未听到。重试与重新提示会重放整段对话,语音重试比文本重试昂贵得多,因为它重复的是音频,而不只是 token。还有被放弃的通话,它在挂断前按完整时长计费,却什么产出都没有。

有效的指标

应以每次完成对话的成本为准,而不是每分钟成本。按分钟计费是计量表,而不是业务价值的单位 — 通过改进模型来缩短通话的改动,可能会提高每分钟单价,同时降低让用户拿到答案的成本。

然后对无人关注的部分进行埋点:会话时长的中位数和 p95、计费时长与实际说话时长之比、放弃率,以及被放弃会话的成本占总成本的比例。积极关闭空闲会话;空闲超时通常是语音技术栈中可获得的单项最大节省。并且把支持打断(barge-in)同时视为成本功能和体验功能,因为用户压过别人说话的每一秒,都是你为生成而付费的一秒。

相关

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com