成功任务单价优于单次请求成本
Updated August 27, 2026 · first published August 27, 2026
单次请求成本指标固然有用,但它不是最终客户采购的工作单元。一次失败报错、经历三次重试或生成不可用结果的请求,不能算作有效交付。在生产环境AI系统中,更稳健的核心指标是成功任务单价:将全部模型与工具调用支出除以满足预定质量阈值的成功任务数。
核心指标公式
计算公式为:单次成功任务成本 = 全部可归因支出 / 成功任务总数。分子需涵盖输入、输出、上下文缓存、思考推理Token、工具调用、失败重试及备选路由成本。在统计前必须先明确定义成功:例如用户接受客服回答、分类置信度达标、或无需人工介入修复即可闭环的业务流程。
单次请求平均值的误导性
当系统中充斥着低成本但无效的失败尝试时,单次请求平均成本反而会显得“便宜”。它还会彻底掩盖昂贵的长尾异常:某项功能的中位数请求成本可能极低,但其失败用例却消耗了大量高阶推理调用和人工审核工时。建议按功能、模型、客户分群和交付结果细分,并同步报告p50和p95成功任务单价与任务完成率。
精确埋点与分母度量
每个模型调用Span都应绑定唯一请求ID与功能标签;应用程序必须在任务终态发出关联该ID的结果事件。记录成功状态、失败归因、人工修正标记、端到端延迟及业务价值。将云厂商发票对齐分子,并定期抽样已交付任务以验证分母的真实性。
依据指标驱动系统优化
如果请求单价偏高但成功率稳定,应重点引入语义缓存或轻量模型路由。如果请求单价很低但成功任务单价极高,说明质量存在缺陷:频繁重试、弱模型推理失败、缺少上下文或停止条件不合理。始终优化包含失败代价的真实成本,并确保质量SLO不出现回退。
Related
Want this applied to your own LLM spend? FinOps LLM runs a free audit of your AI costs and shows where the savings are. Book free audit →