AI 资讯 · 2026年10月5日

OpenAI 强化 ChatGPT Atlas 抗提示注入能力:用自动化红队提前发现浏览器 Agent 漏洞

据 OpenAI 2025 年 12 月 22 日发布的消息,ChatGPT Atlas 正在进一步加强对提示注入攻击的防护。来源显示,OpenAI 采用了基于强化学习训练的自动化红队方法,用更主动的“发现—修复”循环来识别新的攻击路径,并持续加固浏览器 Agent 的安全边界。对于正在评估浏览器代理、自动化执行和多工具调用能力的开发者来说,这一更新的重点并不只是单点漏洞修补,而是说明Agent 化 AI 的安全治理正在从被动响应转向持续对抗测试。

自动化红队为何适合浏览器 Agent 场景

提示注入是 Agent 产品面临的核心风险之一。与传统聊天机器人不同,浏览器 Agent 会读取网页、表单、文档或第三方页面内容,并可能根据这些内容继续执行操作。一旦页面中夹带恶意指令,模型就可能被诱导忽略原本的系统约束,执行非预期行为。

OpenAI 此次强调的自动化红队,核心思路是让系统主动生成、搜索和验证攻击方式,而不是只等待人工安全研究或用户反馈。来源摘要提到,该机制使用强化学习训练,目标是更早发现新的利用方式,并将结果反馈到防御改进中。换言之,Atlas 的安全加固不只是添加几条规则,而是建立一个可持续迭代的测试闭环。

  • 攻击发现:模拟多种提示注入和越权指令组合,寻找浏览器 Agent 的薄弱点。
  • 风险验证:判断攻击是否会影响模型对网页内容、用户意图和系统指令的优先级处理。
  • 补丁迭代:将发现的问题反馈到防护策略中,持续提升模型与产品层的鲁棒性。

对开发者与 API 使用者的影响

从 API 和应用接入角度看,Atlas 的案例提醒开发者:只要应用开始具备浏览网页、调用工具、读写外部数据、执行工作流等能力,提示注入就不再是“聊天内容安全”问题,而会变成工具调用链路安全问题。尤其是使用大模型 API 搭建客服助手、网页总结器、数据采集代理、办公自动化 Agent 的团队,需要把外部内容视为不可信输入。

这也意味着,开发者在选择模型、API 中转或多模型调度方案时,不能只看价格、并发和延迟,还要关注上游模型与平台是否具备持续红队、策略更新、权限隔离等能力。对于通过中转接口接入 OpenAI、Claude、Gemini 等模型的团队,建议在业务侧同步增加安全层,而不是完全依赖模型供应商的默认防护。

Agent 接入时应关注哪些防护点

来源中的“主动发现并修复”思路,对自建 Agent 系统同样有参考价值。开发者可以将浏览器、插件、数据库、代码执行器、企业知识库等能力拆成不同权限级别,并在模型输出进入工具调用前增加审查和确认流程。对于高风险操作,例如发邮件、改数据、下单、提交表单或访问敏感信息,最好设置显式用户确认和操作日志。

在 API 架构上,建议将外部网页内容、用户指令、系统提示词、工具返回结果做清晰分层,避免模型把网页中的文本误认为最高优先级指令。同时,提示词模板应明确要求模型区分“页面内容”和“可执行命令”,并对异常指令进行拒绝或降级处理。对于面向企业客户的产品,还应保留可审计记录,以便复盘潜在注入事件。

行业解读:Agent 越强,安全测试越要自动化

OpenAI 强化 ChatGPT Atlas 的动作,反映出一个趋势:随着 AI 从问答工具转向能执行任务的 Agent,安全挑战会快速扩大。浏览器是最复杂的入口之一,因为它连接了开放网页、账号状态、用户数据和真实操作。人工测试难以覆盖所有页面结构和诱导方式,自动化红队因此会成为大型 AI 产品的基础设施。

对 API 使用者而言,这类进展有两层意义:一方面,上游模型和产品的防护增强,有助于提升 Agent 应用的整体可信度;另一方面,业务方仍需在自己的调用链路中落实权限控制、输入隔离和风险确认。未来评估模型能力时,稳定性、成本、并发之外,安全对抗与工具调用治理也会成为重要指标。

OpenMagic API

Need more than content? Move into the product flow.

If you are here for model access, pricing, developer docs, or the future API console, the dedicated product path now lives on api.openmagic.ai.

登录免费注册