AI 资讯 · 2026年8月22日

OpenAI 与 Anthropic 首次联合安全评测:互测模型对齐、幻觉与越狱风险

据 OpenAI 于 2025 年 8 月 27 日发布的信息,OpenAI 与 Anthropic 公布了一项首次开展的联合安全评测结果。来源显示,双方以交叉测试的方式评估彼此模型,覆盖模型失配、指令遵循、幻觉、越狱等多个安全维度,并强调跨实验室协作在发现风险、改进评测方法和推动行业安全标准方面的价值。对于开发者和 API 使用者而言,这类评测不只是实验室层面的安全研究,也会逐步影响模型调用策略、合规审查、系统提示词设计以及多模型接入方案。

联合评测关注哪些风险

本次评测的核心特点在于“互测”:OpenAI 与 Anthropic 不仅评估自家模型,也测试对方模型在关键安全场景下的表现。来源摘要提到的评估方向包括 misalignment、instruction following、hallucinations、jailbreaking 等。换言之,评测重点并非单一性能榜单,而是围绕模型是否会偏离用户或开发者预期、是否能稳定遵循指令、是否会编造事实,以及是否容易被提示攻击绕过安全边界展开。

这些问题与 API 调用场景高度相关。企业在把大模型接入客服、代码生成、知识库问答、内容审核或自动化代理时,最担心的往往不是单次回答是否“聪明”,而是模型在复杂上下文、恶意输入、边界问题和多轮对话中是否稳定。安全评测的价值,正在从研究指标转向工程指标

  • 模型失配:关注模型输出是否偏离开发者设定目标或安全意图。
  • 指令遵循:检验模型能否在系统提示、用户请求和安全规则之间保持优先级。
  • 幻觉问题:评估模型在不确定或缺少信息时是否生成不可靠内容。
  • 越狱能力:测试模型面对诱导、伪装、角色扮演等攻击时的防护能力。

对 API 使用者的影响:多模型接入不能只看价格和速度

从本站关注的 API 中转与模型调用角度看,这次联合安全评测提醒开发者:选择 OpenAI、Claude、Gemini 等模型时,成本、并发、稳定性固然重要,但安全边界同样会影响线上业务质量。不同模型在指令遵循、拒答策略、事实可靠性和抗越狱方面可能存在差异,应用侧需要根据业务风险做组合选择,而不是简单追求“最强模型”或“最低单价”。

例如,知识库问答系统更重视减少幻觉与引用可靠性;自动化 Agent 更重视工具调用约束和系统指令优先级;面向公众的聊天产品则需要关注越狱与敏感内容绕过。当模型作为 API 被批量调用时,安全问题会被流量放大,一次边界失败可能影响大量用户会话、工单结果或自动化流程。

跨实验室协作或推动评测标准化

来源显示,OpenAI 与 Anthropic 将此次工作描述为具有开创性的联合安全评估,并强调其中体现的进展、挑战和跨实验室合作价值。对行业来说,头部模型公司愿意用相近框架互相测试,有助于减少“各说各话”的模型安全宣传,也可能推动更可比较的评测方法出现。

不过,公开摘要并未给出可直接用于采购决策的完整量化排名,因此开发者仍应谨慎解读。联合评测更像是安全治理方向信号,而不是替代企业自测的最终答案。在真实业务中,仍需要结合自己的提示词、数据源、用户输入、风控策略和调用链路做灰度验证。

接入层应如何应对

对于通过 API 中转、额度池或多模型网关接入大模型的团队,建议把安全评估纳入接入层能力建设:一方面保留不同模型的路由能力,根据任务风险选择模型;另一方面在中间层增加日志、重试、敏感输入检测、输出审查和异常回答回退机制。这样即便底层模型能力变化,也能在业务侧保持更稳定的安全体验。

总体来看,OpenAI 与 Anthropic 的联合安全评测表明,模型竞争正在从单纯能力比拼进入“能力、可靠性与安全性”并重阶段。对 API 使用者来说,未来选型不应只比较上下文长度、响应速度和调用成本,还应把对齐表现、抗攻击能力和幻觉控制纳入长期评估指标。

OpenMagic API

Need more than content? Move into the product flow.

If you are here for model access, pricing, developer docs, or the future API console, the dedicated product path now lives on api.openmagic.ai.

登录免费注册