2025年9月5日,OpenAI发布题为“Why language models hallucinate”的研究解读,聚焦语言模型为什么会生成看似合理但并不真实的内容。来源摘要显示,这项新研究指出,改进评测方法有助于提升AI系统的可靠性、诚实性与安全性。对于依赖OpenAI、Claude、Gemini等模型API构建产品的开发者和企业来说,这一议题并不只是模型研究层面的讨论,而是直接关系到调用结果可信度、业务风控、产品体验以及API接入策略。
所谓“幻觉”,通常指模型在不确定或缺少可靠依据时,仍然给出明确答案。对终端用户而言,这可能表现为错误事实、虚构来源、错误解释或不可靠建议;对API使用者而言,则可能进一步影响客服、检索问答、代码生成、数据分析、自动化运营等场景。OpenAI此次研究将重点放在“为什么会发生”以及“如何通过更好的评估推动改善”上,说明行业对模型能力的关注正在从单纯追求回答流畅度,转向更重视可靠性、可验证性与安全边界。
研究关注点:幻觉并非只靠更大模型就能解决
来源显示,OpenAI的新研究试图解释语言模型产生幻觉的原因,并强调评测机制的重要性。这意味着,模型是否可靠,并不能只看它是否能给出完整、自然、令人信服的回答,还要看它在不确定时是否能够保持诚实,例如承认不知道、提示需要核验,或避免编造没有依据的信息。
从开发者视角看,这一变化非常关键。很多应用在接入大模型API时,会默认“模型回答越完整越好”,但在金融、医疗、法律、企业知识库、工单处理等场景中,错误的确定性比回答不完整更危险。若评测标准过度奖励“给出答案”,而没有充分奖励“知道何时不回答”,模型就可能倾向于输出貌似自信的内容。OpenAI强调改进评测,实际上是在指向一个更现实的问题:模型能力提升不仅来自训练,也来自对模型行为的衡量方式。
对API使用者的影响:提示词、评测与兜底机制都要升级
对使用模型API的团队而言,OpenAI这项研究带来的直接启示是:不能把反幻觉完全交给模型供应商。模型提供方可以持续优化底层能力,但业务方仍需要建立自己的评测集、规则约束与结果校验流程。尤其在多模型接入、模型中转、额度管理和并发调用场景中,稳定性不仅包括接口可用,也包括输出质量的一致性。
开发者在设计调用链路时,可以重点关注以下方面:
- 建立业务评测集:用真实业务问题测试模型是否会在无依据时编造答案,而不仅仅看回答是否流畅。
- 要求模型表达不确定性:在系统提示词中明确要求模型标注不确定内容,必要时回答“无法确认”。
- 引入检索或校验:对知识密集型场景,结合企业知识库、搜索、数据库或规则系统,减少纯模型生成带来的风险。
- 区分模型用途:创意写作可容忍更高自由度,合规、客服、数据解释等场景则需要更强约束。
- 记录与回放调用结果:通过日志观察不同模型、不同参数、不同提示词下的幻觉表现,便于持续优化。
对模型中转与多模型接入生态的解读
对于API中转和多模型聚合使用场景,这一研究也提示平台与使用者需要重新定义“好用”。过去很多团队更关注价格、额度、并发、延迟和可用性;但随着大模型进入生产系统,输出可信度也应成为选型指标。不同模型在不同任务上的幻觉概率和拒答风格可能不同,企业不应只按单次调用成本选择模型,而应结合业务风险评估整体成本。
例如,在一个企业知识库问答系统中,便宜但容易编造的回答,可能带来更高的人工复核和客户沟通成本;而在头脑风暴或文案草拟场景中,模型的创造性可能更有价值。未来API使用者可能会更常采用“分层调用”策略:低风险任务使用成本更优的模型,高风险任务使用更强模型并叠加检索、审核和人工确认。
OpenAI此次研究释放的信号是,行业正在把模型安全与可靠性前置到评测体系中。对开发者来说,最佳实践不是期待某个模型彻底消除幻觉,而是在接入架构中承认幻觉风险的存在,并通过评测、提示词、知识增强、权限控制和日志监控来降低影响。随着评测方法改进,未来模型可能会更擅长在不确定时保持诚实,这将有助于API应用从“能回答”迈向可上线、可审计、可长期运行。
