2022 年 4 月 13 日,OpenAI 发布题为《Measuring Goodhart’s law》的文章,讨论一个在经济学中广为人知、但同样影响 AI 系统优化的问题:“当一个衡量指标变成目标时,它就不再是一个好的衡量指标。”来源摘要显示,OpenAI 将这一问题放在自身研究与产品实践中审视,尤其关注那些“难以衡量”或“衡量成本较高”的目标:当团队试图用可量化指标来代表真实目标并持续优化时,指标本身可能被系统“钻空子”,从而偏离原本想要实现的效果。
对开发者和 API 使用者来说,这并不是一个纯理论话题。无论是模型评测、提示词优化、自动化打分,还是基于用户反馈的排序与路由,只要把某个分数、通过率、点击率、满意度代理指标当作唯一目标,就可能触发 Goodhart 定律。对于通过 OpenAI、Claude、Gemini 等模型 API 构建应用的团队而言,如何设计评测体系,往往会直接影响模型选择、调用成本、上线稳定性以及最终用户体验。
Goodhart 定律为什么会进入 AI 优化问题
来源摘要提到,Goodhart 定律最初来自经济学,但 OpenAI 在处理优化目标时同样需要面对它。AI 系统的很多目标并不容易直接测量。例如“回答是否真正有帮助”“内容是否可靠”“用户是否长期满意”“模型是否在复杂场景中遵循意图”,这些目标很难用单一数字完整表达。于是研究者和开发者通常会选择一些可观测指标作为替代,例如评测集得分、人工偏好分、任务完成率、拒答率、延迟、成本等。
问题在于,替代指标一旦成为优化对象,模型或系统就可能越来越擅长提高该指标,而不一定真正改善原始目标。比如,一个应用如果只优化“回答长度”或“表面完整度”,可能会得到更长、更像专业答案的输出,却未必更准确;如果只优化“通过某个固定测试集”,模型可能在该测试集上表现更好,但迁移到真实业务场景时不一定稳定。指标不是目标本身,而是目标的影子,这正是 Goodhart 定律对 AI 工程的提醒。
对 API 开发者的影响:评测、路由与成本都可能被指标误导
在 API 调用场景中,开发者常常需要在多个模型、多个供应商、不同上下文长度、不同并发策略之间做选择。此时指标体系看似是决策基础,但如果指标设计过窄,就可能导致错误优化。例如只看单次调用价格,可能忽略重试率、失败恢复、人工校正成本;只看平均响应速度,可能忽略高峰期稳定性;只看某类 benchmark 表现,可能忽略企业私有数据、中文场景、多轮对话或工具调用中的实际效果。
对于 Token 中转、API 批发和模型调用中介场景,这一点尤其关键。平台和开发者都需要把成本、额度、并发、可用性、模型能力放在同一套工程视角下评估,而不是只追求某个孤立指标。一个“看起来最优”的指标选择,未必对应真实业务中的最优调用方案。例如某模型在标准问答上表现较好,但如果在特定格式输出、低延迟并发或长文本处理上不稳定,就可能增加整体链路成本。
构建更稳健评测体系的几个方向
来源并未披露具体实验数字或产品策略,但从 Goodhart 定律本身可以推导出一个清晰的工程启示:AI 应用不能依赖单一指标判断质量。对于正在接入大模型 API 的团队,可以从以下几个方面降低指标失真风险:
- 使用多维指标:同时观察准确性、稳定性、延迟、成本、拒答质量、格式遵循、用户反馈等,不把单一分数作为唯一目标。
- 保留真实场景样本:除公开评测外,应建立来自自身业务的测试集,覆盖真实用户问题、边界输入和异常情况。
- 定期更换或扩展评测集:避免模型、提示词或系统策略只适配固定测试题,导致上线后泛化不足。
- 区分代理指标和最终目标:例如“响应更快”不等于“体验更好”,“成本更低”不等于“总体更省”。
- 结合人工审查与自动化评估:在高风险或高价值任务中,自动分数需要与人工判断、错误分析配合使用。
从中转与模型接入角度看:不要只优化“便宜”或“高分”
对 openmagic.ai 关注的 API 使用者而言,Goodhart 定律还意味着:模型接入方案的优化不应只围绕“最低单价”或“最高榜单分数”展开。真正可持续的调用架构,需要考虑请求分发、失败重试、限流策略、上下文管理、缓存、日志评测以及供应商切换能力。一个稳定的中转层或统一 API 封装,可以帮助团队在不同模型之间做动态选择,但前提是评测目标足够贴近业务。
例如,客服机器人、代码助手、知识库问答、内容生成、数据抽取等场景,对“好”的定义并不相同。客服更重视安全与一致性,代码助手更关注可运行性和上下文理解,数据抽取更看重结构化输出稳定性。如果所有场景都用同一个指标排序模型,结果往往会被 Goodhart 定律放大偏差。
OpenAI 此次围绕 Goodhart 定律展开讨论,提醒行业在追求可量化优化时保持谨慎。对开发者来说,最重要的不是放弃指标,而是理解指标的边界:把指标作为导航工具,而不是把指标本身当成终点。在大模型 API 进入更多生产系统后,谁能更好地设计评测、控制成本并保持真实效果,谁就更可能获得长期稳定的工程收益。
