OpenAI 数学成果发布与 AI 研究成本
更新于 October 8, 2026 · 首次发布 October 8, 2026
OpenAI 于 10 月 6 日发布的数学成果,是一个有用的成本治理案例,而不是公开的价格基准。公司表示,平均每项成果使用的算力大致相当于三小时的 ChatGPT Pro 思考,但它没有公布内部模型每项成果的 API 价格。财务团队应将实验支出、评审工作量和已验证的结果分开追踪,而不是把这一算力等价值换算成一个凭空推算的美元数字。
OpenAI 披露了什么
OpenAI 发布了 722 篇数学手稿,归为 372 个系列,另有部分 Lean 形式化证明,以及其研究过程的细节。它表示,平均每项成果使用的算力约相当于三小时的 ChatGPT Pro 思考。该仓库还说明,收录的成果处于不同的验证阶段,部分未经形式化的成果可能存在问题。源材料请参见 OpenAI 的发布说明和研究仓库。
这些披露描述的是研究产出和一个近似的算力等价值。它们没有提供内部模型的 API 费率、按手稿计量的精确用量、从 Pro 算力到美元的换算方式,或经独立验证的成功率。财务模型应保留这些未知项,使其清晰可见。
不要把算力等价值当作价格
消费级套餐的时间等价指标,与按量计费的 API 用量并不相同。它或许可以用来传达规模,但公开披露中并未说明 token 数量、硬件分配、边际服务成本或计费单位。把三小时乘以一个猜测的 GPU 小时费率,就等于声称了源数据并不支持的精确度。
对于可部署的工作负载,应使用服务商的实际账单记录,或你自己的插桩推理台账。对于尚未发布的内部模型,应将披露的算力等价值作为单独的研究单位指标记录,并把任何内部转移价格明确标为假设。不要把这些假设与实际发票成本并列,除非两者有清晰的区分。
衡量经过评审后仍然有效的工作
对于研究项目,原始的产出数量会奖励数量本身,即使结果需要修正或无法复用。应将支出与一个验收漏斗配对:
- 已尝试:发送给系统的研究问题或假设。
- 候选:通过第一轮技术筛选的产出。
- 已验证:由合格评审人或证明检查器独立核实的结果。
- 可复用:进入论文、产品或下游流程的已验证结果。
应按已尝试的问题以及按已验证的结果,分别报告算力或 API 支出。如果决策关乎整个项目的经济性,还应计入评审人时间、编排、存储以及后续运行。失败的尝试和修订应保留在分母中;将其排除会使单位成本显得人为偏低。更宽泛的定义请参见每个成功任务的成本和推理模型成本追踪。
为研究运行设置预算闸门
在试点之前,应设定项目上限、每个问题的最高支出或算力额度,以及下一批次之前的评审检查点。当以下三种情况之一出现时,应停止或暂停运行:工作单位预算已耗尽;经独立验收的结果速率低于约定下限;或评审人无法足够快地验证输出。
在每个检查点,比较下一批的边际成本与已验证结果的价值。技术验收决定和预算例外应由不同的负责人把关。一大批看似合理的输出本身,并不足以作为提高上限的依据。
财务部门今天能得出什么结论
这一公告使高算力科学工作成为一个具体的规划场景。但它并不能确立商业价格、企业投资回报率,或生产工作负载每个已验证答案的成本。目前,应利用这一发布来定义你在批准类似项目之前所需的台账和评审闸门。当实际用量和已验证结果可用时,再用实测成本替换算力等价的代理指标。关于如何将这些成本分摊到研究项目和结果上,可参阅配套指南:AI 研究成本分摊。
常见问题
OpenAI 平均每项数学成果使用了多少算力?
OpenAI 表示,大约相当于三小时的 ChatGPT Pro 思考算力。这不是公布的美元成本,也不是每项成果的 API 价格。
财务能否根据这个数字估算美元成本?
仅凭公开披露无法做到。它没有说明内部模型的 API 价格、每项成果的 token 数,也没有给出从 Pro 算力等价值到美元的换算率。
FinOps 应如何衡量 AI 研究?
追踪实际的算力或 API 费用、尝试次数、经独立验证的结果、评审人工时以及可复用的产出。除总支出外,还应报告每个已验证结果的成本,并将估算值与发票数据分开标注。
相关阅读
相关文章
想将这些方法用于您的技术栈吗? 请准备好供应商账单、网关日志和主要工作流;我们会梳理成本驱动因素与节省空间。 预约免费审查 →