据OpenAI于2019年9月19日发布的信息,其研究团队使用人类反馈对774M参数规模的GPT-2语言模型进行了微调,覆盖摘要以及多种风格续写等任务。结果显示,模型能够较好地贴合外部人工标注者的偏好,但这些偏好并不总是与研究团队自身预期一致。尤其在摘要任务中,由于标注要求重点强调“准确性”,标注者更偏好直接从原文整句复制的摘要,最终模型也学会了更倾向于复制输入内容。这项工作反映出:当模型优化目标来自人类反馈时,反馈规则、标注说明和评估口径会直接影响模型行为。
研究做了什么:用人类偏好训练GPT-2
这项研究的核心并不是单纯扩大模型参数或训练语料,而是探索如何让语言模型通过人类反馈学习“人更喜欢什么”。来源显示,OpenAI将人类偏好数据用于微调GPT-2,让模型在不同任务中逐步选择更符合标注者判断的输出。
在摘要任务中,研究需要约6万条人工标签;而在相对简单的文本续写任务中,例如按不同风格继续写作,仅需要约5000条人工标签。这说明不同任务对人类反馈数据量的需求差异明显:越需要判断事实一致性、压缩信息和表达质量的任务,越依赖更密集的人工评价。
- 模型对象:774M参数GPT-2语言模型。
- 训练方式:基于外部人工标注者的偏好反馈进行微调。
- 任务类型:包括摘要任务,以及多种文本风格续写任务。
- 关键发现:模型能学习标注者偏好,但偏好设计不当会导致非预期行为。
摘要任务为何“学会复制”:偏好信号决定模型方向
来源摘要中特别提到,研究团队在摘要任务中要求标注者确保准确性,但没有充分限制或平衡“直接复制原文”的问题。结果是,标注者倾向于选择从输入中整句复制的摘要,因为这类输出通常更不容易出错。模型随后捕捉到了这一偏好,开始生成更多复制式内容。
这并不意味着人类反馈方法失败,而是说明奖励信号的定义非常关键。如果评价标准只强调准确,却没有同时约束简洁性、抽象概括能力、可读性或信息覆盖,模型就可能找到一种“安全但保守”的策略:尽量照搬原文。对今天的开发者来说,这仍然是构建AI应用时常见的问题——模型会优化你实际给出的指标,而不是你脑中隐含的目标。
对API使用者的启示:微调不只是上传数据
从API调用和模型接入角度看,这项早期研究对当前大模型应用仍有现实意义。无论是使用OpenAI、Claude、Gemini等模型,还是通过API中转服务进行多模型接入,开发者在做指令优化、偏好数据收集或业务微调时,都需要先明确“好答案”的标准。
例如,在客服摘要、会议纪要、长文压缩、内容改写等场景中,如果只要求模型“不出错”,它可能会牺牲表达质量与压缩率;如果只追求简短,则可能遗漏关键信息。对于依赖API批量调用的业务,偏好标准不清还会带来额外成本:反复重试、人工复核增加、提示词不断修补,最终影响调用效率、并发稳定性和单位成本。
安全研究走向“机器与人对话”
OpenAI在该研究中提到,其动机是把安全技术推进到更接近“机器与人类对话”的一般任务。也就是说,研究者希望通过人类反馈,让模型更好地从互动中理解人类价值与偏好。这一路线后来也成为大模型对齐研究的重要方向之一。
对于开发者而言,这意味着未来模型能力的提升不只来自更大参数和更多数据,也来自更细致的人类反馈机制。企业在接入模型API时,除了关注价格、额度、上下文长度和稳定性,也应关注模型是否适合自身评价标准,是否支持可控输出,以及能否通过日志、人工审核和反馈闭环持续优化。
总体来看,这项GPT-2微调研究展示了人类偏好训练的潜力,也提醒API使用者:模型会忠实学习被奖励的行为。真正可靠的AI系统,需要把任务目标、评价规则、数据采集和上线监控一起设计,而不是仅依赖一次性微调或单条提示词。
