跳至正文

独立 Jev 测试对成本说明了什么

更新于 September 21, 2026 · 首次发布 September 21, 2026

快速结论: 早期独立测试支持了 Jev 的基本观点:它是一种快速、低成本的方式来做类型化决策。但也需要一个限定条件:节省多少取决于它替代的是什么。将 Jev 与一个慢速推理调用相比,结果非常显著;与一个小型结构化输出模型相比,差异较小,但依然有用。 我们找到的最详细、可复现的测试是 jev-measured,它通过 OpenRouter 调用...

早期独立测试支持了 Jev 的基本观点:它是一种快速、低成本的方式来做类型化决策。但也需要一个限定条件:节省多少取决于它替代的是什么。将 Jev 与一个慢速推理调用相比,结果非常显著;与一个小型结构化输出模型相比,差异较小,但依然有用。

我们找到的最详细、可复现的测试是 jev-measured,它通过 OpenRouter 调用 Jev,覆盖八个用例,包括路由、工具选择、内容审核、重排序、线索评分和护栏。其报告的决策成本介于 $0.0000153 和 $0.0000254 之间。在其正面对比的运行中,Jev 的中位延迟为 352 ms,平均成本为 $0.0000188。

节省真实存在的场景

在该测试中,与 GPT-5 Nano 相比,Jev 每个测试样本的成本约低 18 倍,且速度快得多。当旧工作流需要让生成模型读取状态、推理、生成格式化的回复,然后再由代码从文本中提取单个决策时,这一点意义重大。

与 Gemini Flash Lite 和 Mistral Small 相比,测得的成本差距分别只有 1.7 倍和 1.4 倍。在一个单问题用例中,小模型反而更便宜。这并不意味着 Jev 失败了,而是界定了真正的机会:当一次调用可以替代一个重复的决策步骤,或者多个决策问题可以一起评估时,Jev 的优势最强;而不是被强行用于每一个琐碎的分类。

类型化输出消除了一项真实成本

同一基准测试最初在聊天模型基线中发现了模式错误:本应输出概率的地方返回了布尔值,概率以字符串而非数字形式返回,还有字段缺失。严格的 JSON Schema 模式消除了这些错误。这个修正很重要。好的 FinOps 写作不会隐藏基线的最佳配置。它确实表明,输出校验、修复、重试和解析本身就是成本,而 Jev 为其自身的输出契约消除了整类此类成本。

准确性和校准仍决定推广节奏

成本和延迟并不能回答一个决策是否足够好到可以自动化。一项独立的物理 AI 测试报告称,其与自身 300 个事件模板的一致率为 91.3%;而一项小型支持工单测试则没有发现证据,支持“Jev 比所有聊天模型都更准确”这一笼统说法。两者都是早期、范围狭窄的实验。它们指向了正确的生产测试方法:用你自己已标注的案例评估 Jev,并检查每个置信度水平下的准确性。

一个实用的评分卡包含五项:决策准确率、置信度校准、中位和 P95 延迟、每个正确决策的成本,以及升级率。由此得出可操作的结果:置信度超过此阈值的案例路由给 Jev;其余的交给更大的模型或人工复核。这比夸大的发布宣传,或泛泛地警告不要相信模型,都更有用。

相关文章


想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →

返回 finopsllm.com