据 OpenAI 于 2022 年 4 月 13 日发布的文章《Measuring Goodhart’s law》显示,团队将经典的古德哈特定律放到 AI 目标优化语境中重新讨论:当一个衡量指标被直接当作优化目标时,它往往会失去原本作为衡量工具的可靠性。这一问题最早来自经济学,但来源摘要指出,OpenAI 在处理那些难以衡量、衡量成本较高的目标时,也必须面对类似挑战。对于开发者和 API 使用者而言,这不仅是研究话题,也关系到模型评测、自动化打分、提示词优化以及业务指标设定的可靠性。
从经济学规律到模型优化问题
古德哈特定律通常被概括为:“当一个指标成为目标,它就不再是一个好的指标。”在 AI 系统中,开发者经常需要把复杂目标转化为可计算、可比较、可优化的指标。例如回答质量、用户满意度、安全性、真实性、任务完成率等,都可能被压缩成某种评分或代理指标。
问题在于,真实目标往往难以直接测量,或者测量成本很高。来源摘要提到,OpenAI 在优化这类目标时需要“grapple with”,也就是持续处理其中的矛盾:如果只优化容易获得的分数,系统可能学会迎合分数,而不是提升真正想要的能力。指标本身越被强化为训练或评估目标,越可能出现偏离原意的风险。
对 API 开发者的影响:评测指标不能等同于真实体验
在 API 接入场景中,很多团队会用自动化评测来判断模型是否适合上线,例如用固定测试集比较不同模型、用规则打分筛选输出、用用户反馈调整提示词。这些方法有价值,但如果业务团队把某个单一分数当作唯一目标,就可能触发古德哈特定律式的问题。
例如,一个客服机器人可能在“回答是否包含关键词”的指标上表现更好,但真实用户并不一定觉得更有帮助;一个内容生成系统可能更容易通过格式检查,却未必提升事实准确性或可读性。对使用 OpenAI、Claude、Gemini 等模型 API 的团队来说,评测体系应当服务于真实业务目标,而不是让模型单纯追逐评测表格中的分数。
- 不要只依赖单一自动评分,应结合人工抽检、用户反馈和线上效果。
- 区分“代理指标”和“最终目标”,避免把可测量性误认为重要性。
- 在提示词优化、模型选择和路由策略中,关注失败案例而非只看平均分。
- 当指标被用于持续优化时,应定期检查它是否仍能代表真实需求。
模型中转与多模型接入场景下的解读
对于通过中转服务或统一网关接入多家模型的开发者,古德哈特定律也提醒我们:模型选型不能只看某个榜单分数或一次性测试结果。不同模型在速度、稳定性、上下文处理、工具调用、成本控制和安全约束方面的表现差异,往往难以被一个指标完整概括。
如果企业只以“最低成本”作为优化目标,可能牺牲可用性和输出质量;如果只追求“最高评分模型”,又可能忽略调用延迟、额度限制和并发稳定性。更合理的做法是建立分层指标:基础层看可用性与错误率,业务层看任务完成效果,成本层看单位请求投入,风险层看安全与合规要求。这样可以减少单一指标被过度优化带来的偏差。
指标治理将成为 AI 应用工程的一部分
OpenAI 这篇文章的核心意义在于,把一个看似抽象的经济学规律引入 AI 优化实践。随着模型能力增强,开发者越来越依赖自动评测、奖励模型、A/B 测试和数据闭环来改进应用。此时,指标设计本身就成为工程能力的一部分。
对 API 使用者来说,真正关键的不是放弃指标,而是承认指标有边界。好的 AI 应用评估体系,应同时包含可量化指标与人工判断,并随着业务变化持续校准。当模型调用规模扩大、成本和稳定性成为日常运营问题时,如何避免“为了指标而优化”,将直接影响产品体验和长期投入产出比。
