完全负载智能体成本工作表
更新于 October 8, 2026 · 首次发布 October 8, 2026
模型 token 总量并不等于完全负载的智能体成本。一次生产运行还可能消耗托管搜索、代码执行、存储、重试、备用模型以及人工审核。一份有用的工作表会把每一笔费用关联到运行 ID,并把已计量的供应商费用与分摊的管理费用和人工估算分开。
这份工作表是对单个成功任务的成本的补充:先汇总完整的成本台账,再把它除以通过既定成功标准的结果。它也把独立的工具计费扩展为可重复使用的财务记录。
从每个事件一行开始
为用户意图使用稳定的工作流 ID,为每次尝试使用运行 ID。记录时间戳、环境、团队或租户、工作流、运行、供应商、服务、资源 ID、数量、单位、费率卡版本、货币,以及发票或计量来源。每次模型调用、工具调用、计算任务或审核项各占一个事件。这样重试行为可见,财务无需猜测是哪个嵌套操作产生了这些费用,也能对账总额。
工作表各列
- 模型:供应商、模型、可获取的输入/输出/缓存/推理单位、实测费率,以及直接费用。
- 工具:搜索、检索、浏览器、代码执行以及其他按量计费的服务,附调用次数或运行时长,以及直接费用。
- 计算与存储:沙箱或容器运行时、加速器或 CPU 时间、持久化存储,以及(如果计费)网络费用。
- 可靠性工作:重试、备用调用、被放弃的分支以及修复运行。即使它们没有产生有用的输出,也要计入运行总成本。
- 验证:评估器调用和人工审核分钟数,人工成本需标注为内部估算,而不是供应商发票上的费用。
- 共享平台:编排、可观测性、预留容量或共享存储的分摊,每项都注明其分摊依据和周期。
分别计算直接成本与完全负载成本
直接运行成本是归属于该次运行的已计量模型、工具、计算和存储费用之和。完全负载成本再加上平台管理费用和审核人工中的既定份额。共享成本应使用稳定的分摊依据,例如实测运行时长、预留容量或有文档记录的每次运行分摊。请公布分摊依据及其时间窗口;除非 token 确实能解释资源消耗,否则不要按 token 数量分摊固定成本。
一个小型假设示例可以让公式更清楚:如果某次运行有 $0.40 的模型费用、$0.10 的工具费用、$0.20 的沙箱计算费用,以及 $0.30 的分摊审核与平台成本,那么直接成本报告为 $0.70,完全负载成本为 $1.00。这些数字只用于说明算术,并非市场价格或基准。
区分尝试与结果
所有尝试都计入支出,然后根据一条明确的规则,将最终工作流标记为成功、失败、被放弃,或需要人工完成。报告每个已完成工作流的成本时,应同时给出成功率、重试率和审核工作量。对于成功任务指标,使用该期间内符合条件的总支出,除以通过成功测试的工作流数量。不要把失败的运行从分子中剔除,也不要把中间的智能体步骤算作单独的成功。
对账与治理工作表
在用量数据结算之后,将事件总额与供应商发票和云计费导出数据对账。单独说明积分、折扣、最低消费、延迟事件和货币换算。保存价格来源和生效日期,以便历史成本可以被重新计算,而不是用今天的费率去计算上个月的用量。
为每个工作流指定负责人,并设定单次运行预算、总体周期预算和升级路径。当某个工作流超出预算时,记录原因以及它是否被允许继续运行。运行时强制执行的模式,请参阅自主智能体的三类预算。
常见问题
智能体成本工作表应包含什么?
记录模型用量、计费工具、计算、存储、重试、备用调用、验证,以及单独标识的共享平台分摊和人工估算。
失败的智能体运行是否应计入单个任务成本?
应将其支出计入总额。使用既定的成功规则报告成功工作流的数量,使失败在单位经济性中保持可见。
如何避免重复计算共享平台成本?
让直接费用保留在其所属事件上,用一个公布的分摊依据在独立台账中分摊共享成本,并将分摊总额与平台成本池对账。
相关阅读
相关文章
想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →