OpenAI 提出 AI 时代效益计分板:从 Token 成本转向每美元有用智能

OpenAI 于 2026 年 7 月 17 日提出「每美元有用智能」框架,建议企业以完成的工作、每项成功任务成本、可靠程度及规模效益衡量 AI 投资。

OpenAI 于 2026 年 7 月 17 日发布〈A scorecard for the AI age〉,把企业评估 AI 的问题从「买了多少席位、用了多少 Token」转向「AI 实际完成了多少有用工作」。文章以 CFO 关心的投资回报为入口,提出一个名为「每美元有用智能」的衡量方向。

这个框架包括四个问题:AI 完成了多少重要工作、每项成功任务的完整成本是多少、人是否可以依赖结果,以及随着使用量增加,每一美元是否带来更多价值。OpenAI 认为,单看 Token 价格不足以判断效益,因为较便宜的模型可能需要更多重试、更长等待或更多人工修正。

第一步是把指标放回真正发生工作的系统。客服团队可以衡量成功解决的个案,工程团队可以衡量通过测试及 review 的代码变更,法律团队则可以衡量准时而准确完成的合同审阅。文章建议先选择一条 workflow,先定义「完成」的标准,再在原本的工作系统内记录结果。

第二步是计算每项成功任务的完整成本。这不只包括模型及工具用量,也包括尝试次数、延迟、员工时间、人工 review 和返工。OpenAI 以自家模型作例子,说明较高单价的模型如果能以较少次数达到质量要求,总成本未必比低价模型高;企业仍然应该用自己的代表性案例和质量门槛重新验证。

可靠程度是这套方法的另一个重点。OpenAI 建议把结果分成「交付后可以直接使用」、「需要修正」及「需要升级由人完成」三类,因为这比单一准确率更能反映 AI 是否真的减少了完成工作的负担。当系统从草稿走向跨工具、处理例外和执行动作时,数据可见范围、可使用的系统、人工批准点及权限边界都需要先写清楚。

最后,企业要观察规模效益:在同一条 workflow 中,合格完成的任务是否增长得比总成本快,而且质量没有下降。这使 AI 投资更像一个可分阶段验证的 portfolio:先探索模型能否处理问题,再用真实案例验证,最后才投资整合、治理、可靠性及变更管理。

这篇文章提供的是 OpenAI 的管理框架,而不是独立的行业标准;文中对 ChatGPT Work、GPT-5.6 和计算基础设施的描述也带有供应商视角。对企业来说,最有用的做法是保留这四个问题,再用自己的成功定义、审批记录、成本数据和实际业务结果建立基线。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。