据 OpenAI 于 2025 年 8 月 27 日发布的信息,OpenAI 与 Anthropic 公布了一项首次开展的联合安全评测结果。来源显示,双方以交叉测试的方式评估彼此模型,覆盖模型失配、指令遵循、幻觉、越狱等多个安全维度,并强调跨实验室协作在发现风险、改进评测方法和推动行业安全标准方面的价值。对于开发者和 API 使用者而言,这类评测不只是实验室层面的安全研究,也会逐步影响模型调用策略、合规审查、系统提示词设计以及多模型接入方案。
联合评测关注哪些风险
本次评测的核心特点在于“互测”:OpenAI 与 Anthropic 不仅评估自家模型,也测试对方模型在关键安全场景下的表现。来源摘要提到的评估方向包括 misalignment、instruction following、hallucinations、jailbreaking 等。换言之,评测重点并非单一性能榜单,而是围绕模型是否会偏离用户或开发者预期、是否能稳定遵循指令、是否会编造事实,以及是否容易被提示攻击绕过安全边界展开。
这些问题与 API 调用场景高度相关。企业在把大模型接入客服、代码生成、知识库问答、内容审核或自动化代理时,最担心的往往不是单次回答是否“聪明”,而是模型在复杂上下文、恶意输入、边界问题和多轮对话中是否稳定。安全评测的价值,正在从研究指标转向工程指标。
- 模型失配:关注模型输出是否偏离开发者设定目标或安全意图。
- 指令遵循:检验模型能否在系统提示、用户请求和安全规则之间保持优先级。
- 幻觉问题:评估模型在不确定或缺少信息时是否生成不可靠内容。
- 越狱能力:测试模型面对诱导、伪装、角色扮演等攻击时的防护能力。
对 API 使用者的影响:多模型接入不能只看价格和速度
从本站关注的 API 中转与模型调用角度看,这次联合安全评测提醒开发者:选择 OpenAI、Claude、Gemini 等模型时,成本、并发、稳定性固然重要,但安全边界同样会影响线上业务质量。不同模型在指令遵循、拒答策略、事实可靠性和抗越狱方面可能存在差异,应用侧需要根据业务风险做组合选择,而不是简单追求“最强模型”或“最低单价”。
例如,知识库问答系统更重视减少幻觉与引用可靠性;自动化 Agent 更重视工具调用约束和系统指令优先级;面向公众的聊天产品则需要关注越狱与敏感内容绕过。当模型作为 API 被批量调用时,安全问题会被流量放大,一次边界失败可能影响大量用户会话、工单结果或自动化流程。
跨实验室协作或推动评测标准化
来源显示,OpenAI 与 Anthropic 将此次工作描述为具有开创性的联合安全评估,并强调其中体现的进展、挑战和跨实验室合作价值。对行业来说,头部模型公司愿意用相近框架互相测试,有助于减少“各说各话”的模型安全宣传,也可能推动更可比较的评测方法出现。
不过,公开摘要并未给出可直接用于采购决策的完整量化排名,因此开发者仍应谨慎解读。联合评测更像是安全治理方向信号,而不是替代企业自测的最终答案。在真实业务中,仍需要结合自己的提示词、数据源、用户输入、风控策略和调用链路做灰度验证。
接入层应如何应对
对于通过 API 中转、额度池或多模型网关接入大模型的团队,建议把安全评估纳入接入层能力建设:一方面保留不同模型的路由能力,根据任务风险选择模型;另一方面在中间层增加日志、重试、敏感输入检测、输出审查和异常回答回退机制。这样即便底层模型能力变化,也能在业务侧保持更稳定的安全体验。
总体来看,OpenAI 与 Anthropic 的联合安全评测表明,模型竞争正在从单纯能力比拼进入“能力、可靠性与安全性”并重阶段。对 API 使用者来说,未来选型不应只比较上下文长度、响应速度和调用成本,还应把对齐表现、抗攻击能力和幻觉控制纳入长期评估指标。
