OpenAI 提出 AI 时代新指标:用"有用智能每美元"衡量投入产出
当企业财务负责人追问人工智能投入的实际回报时,OpenAI 试图给出更清晰的答案。这家公司在 7 月 17 日发布的长文中指出,传统软件行业以采用率衡量成败的标准——席位数量、活跃用户、许可证续费——在 AI 时代已经失效,真正的标尺应是模型实际完成的工作量。
OpenAI 认为,评估 AI 投入的核心经济命题在于:人工智能创造的价值增长是否快过其生产成本增长。仅比较每 token 成本并不足够,因为一个便宜模型可能需要反复试错、耗费更多人工审核;而一个昂贵的模型或许一次就能完成任务。真正的成本是产出成功结果的完整代价,以及该成果所创造的价值。
"有用智能每美元"回答四个关键问题
OpenAI 提出"有用智能每美元"作为 AI 时代的记分卡,涵盖四个维度:AI 是否在完成有意义的工作;每项成功任务的成本;结果是否可信赖;以及随着用量增长,每美元投入是否创造更多价值。
第一,完成了多少有用工作。价值只在 token 转化为人们可直接使用的实际产出时才产生。模型能力越强,能处理的任务越复杂——保持上下文、多步推理、跨工具协作并动态调整。务实的做法是锁定具体工作流,在真实系统中度量结果。例如,财务团队为预测评审做准备时,ChatGPT Work 可完成数据导出、变化识别、幻灯片重建等杂务,让团队专注分析变化原因和下一步决策。
第二,成功任务的实际成本。AI 任务成本差异巨大:快速回答消耗计算极少,而编码、研究、财务类工作流涉及深度推理和大量操作。单次成功任务成本由价格、实际计算量和正确结果概率决定;企业总成本还需叠加员工时间、人工审核、重试和返工。因此每 token 最低价未必等于每结果最低成本——前沿模型若一次给对答案,省下的重试和审核可能使其成为最划算选择。
OpenAI 新发布的 GPT-5.6 按此逻辑设计三个层级:旗舰 Sol、平衡型 Terra、最快最省的 Luna。客户需根据整笔任务的经济性选择:高吞吐流程用 Luna,深度任务用 Terra,需要更强推理时用 Sol。数据显示,在 Artificial Analysis 编程智能体指数上,GPT-5.6 Sol 以更少输出 token 创下新优;在 DeepSWE v1.1 长周期工程任务中,以更低预估 API 成本达到更高完成率。
第三,可靠性,即 AI 正确完成工作的频率。AI 采用通常分阶段深化:从辅助起草,到工具间推理,再到主动采取行动、处理异常、跑完整个工作流。每一步都创造更多价值,也提出更高要求。可靠性直接转化为成本节约——结果准确、来源可靠、前后一致,审查和返工时间减少,成功任务成本降低。
OpenAI 建议追踪三类结果:可直接使用、需要修正、需要升级处理,这比单纯模型准确率更能反映 AI 是否减少了实际工作量。同时需明确边界:定义系统可访问的数据、可更改的系统、需人工审查的操作环节。ChatGPT Work 建立在企业级安全合规基础上,支持在保持监督的同时接入更有价值的流程。
第四,规模化价值,即随着用量增长,每美元投入能否完成更多工作。企业可长期追踪同一工作流:统计达标任务数、总成本、每项成功任务成本。若工作量增长快过总成本、质量保持不变或提升,则每美元产出更多价值。算力处于核心位置——训练算力构筑未来能力,推理算力交付当下价值,两者最终都需转化为更好的客户成果。
构建自我强化的价值循环
更优模型、高效推理、专用硬件、更高利用率、智能路由和产品设计,都能提升算力回报。这些改进自我累积:更好基础设施加速研究,研究催生更强模型,模型改进产品,产品推动采用与收入增长,进而支撑下一代研究投入。
OpenAI 以统一智能平台整合这些要素:用户通过 ChatGPT 和 ChatGPT Work 使用,开发者通过 Codex 和 API 构建,企业将其部署进真实工作系统。任何一层改进,所有产品和客户共同受益。
将四项指标合一,核心问题是:每单位成本换来的有用智能是否在持续上升。OpenAI 将自身职责归结为让这个等式在每一代模型上都变得更好——更强模型、更快更可靠的结果、为真实工作压低的成本。当 AI 以"每美元有用智能"而非 token 流水账说话时,价值才被真正算清。