资讯行业动态··来源: OpenAI·原文 →

OpenAI 强化 ChatGPT Atlas 浏览器代理防御提示词注入攻击

OpenAI 近期发布针对 ChatGPT Atlas 浏览器代理(Browser Agent)的安全更新,应对新型提示词注入(Prompt Injection)攻击。通过内部自动化红队测试发现新攻击类别后,团队部署了对抗训练模型和增强防护措施。文章详细披露了 OpenAI 如何利用强化学习训练自动化攻击者,通过端到端模拟和高计算量测试,在攻击出现在野外之前提前发现漏洞并快速修复。

OpenAI 强化 ChatGPT Atlas 浏览器代理防御提示词注入攻击
[广告位 · 上线后接 AdSense]

OpenAI 强化 ChatGPT Atlas 浏览器代理防御提示词注入攻击

OpenAI 最近给 ChatGPT Atlas 的浏览器代理(Browser Agent) 来了次大升级,专门对付越来越狡猾的 提示词注入(Prompt Injection) 攻击。这可是 OpenAI 目前最牛掰的代理功能之一,能让 AI 像真人一样在网上冲浪、点按钮、打字,直接参与到日常工作中。但能力越强,风险也越大——代理成了黑客眼中的香饽饽。

提示词注入咋威胁浏览器代理

提示词注入攻击的套路就是在 AI 代理处理的内容里偷偷塞进恶意指令,让代理跑偏,执行攻击者的命令。对于浏览器代理来说,这就开辟了个全新的攻击面:黑客不用再费劲钓鱼或者找浏览器漏洞,直接"忽悠"代理就完事了。

OpenAI 举了个例子:假设用户让代理"看看未读邮件,总结下重点",黑客可能事先发封带隐藏指令的恶意邮件,让代理别管用户的话,直接把敏感税务文件发到黑客邮箱。因为代理在工作流中会读到这封邮件,要是没发现注入指令,隐私数据就泄露了。

攻击面大到没边:邮件和附件、日历邀请、共享文档、论坛帖子、社交媒体内容、随便哪个网页——代理可能接触到的任何不可信内容都可能藏着注入指令。而代理能干的活儿(转发邮件、转账、编辑/删除云端文件等)和用户权限一样,攻击成功了影响范围也贼广。

用 AI 打 AI:自动化红队和强化学习

为了抢在黑帽黑客前发现漏洞,OpenAI 搞了个 基于大语言模型的自动化攻击者(Automated Attacker),用 端到端强化学习(End-to-End Reinforcement Learning) 训练它的"红队技能"。这套系统有两把刷子:

  1. 反事实模拟(Counterfactual Rollout):攻击者在推理链(Chain of Thought)里提出候选注入指令后,先发给外部模拟器测试。模拟器跑完整个防御代理的行为轨迹,返回详细的推理和操作记录。攻击者根据反馈不断优化攻击,模拟好几次才提交最终版本——这比单次通过/失败信号提供了更丰富的学习信号,也大大扩展了攻击者的 测试时计算量(Test-Time Compute)

  2. 白盒优势(White-Box Access):内部攻击者能访问防御模型的完整推理轨迹(不对外公开),形成信息不对称——这是 OpenAI 相对外部对手的核心优势,有助于更早发现潜在漏洞。

这次安全更新就是这套自动化红队系统发现的 新型攻击类别 催生的。OpenAI 立马部署了 对抗训练模型(Adversarially Trained Model) 和增强防护措施,形成了快速响应闭环。

长期愿景:持续对抗的安全循环

OpenAI 明确表示,提示词注入是长期 AI 安全挑战,得像对付不断演变的网络钓鱼那样持续加固防御。团队的长期策略靠三大支柱:

  • 白盒模型访问:深度理解自家模型行为
  • 防御机制深度掌握:快速定位薄弱环节
  • 计算规模优势:大规模模拟攻击场景

目标是在外部攻击者之前发现漏洞、更快修复、持续收紧响应周期。结合前沿研究(新技术对抗注入)和其他安全控制措施,这种复合循环能让攻击成本越来越高、难度越来越大,从根本上降低真实世界的提示词注入风险。

最终目标:让用户能像信任一位高度胜任、具备安全意识的同事或朋友一样,信任 ChatGPT 代理使用自己的浏览器。


关键术语保留:Prompt Injection(提示词注入)、Browser Agent(浏览器代理)、Reinforcement Learning(强化学习)、Counterfactual Rollout(反事实模拟)、Test-Time Compute(测试时计算)、White-Box Access(白盒访问)。


本文基于 OpenAI 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://openai.com/index/hardening-atlas-against-prompt-injection

常见问题

提示词注入攻击与传统网络钓鱼有何区别?
传统钓鱼攻击目标是人类用户,通过伪装页面或邮件诱骗用户输入密码或点击恶意链接。提示词注入则直接攻击 AI 代理本身,在代理处理的内容(如邮件正文、网页文本)中嵌入隐藏指令,诱使代理执行攻击者意图而非用户指令。攻击者无需突破浏览器漏洞或欺骗人类,只需'说服'AI 即可。
OpenAI 的自动化红队系统如何比外部攻击者更快发现漏洞?
OpenAI 的内部攻击者具备三大优势:一是可访问防御模型的完整推理轨迹(外部攻击者看不到),形成信息不对称;二是通过反事实模拟反复测试攻击效果,每次迭代都能获得详细反馈;三是利用强化学习让攻击者从成功和失败中自我改进。这些白盒访问和计算规模优势使 OpenAI 能在攻击出现在野外之前提前发现并修复。
中国开发者部署 AI 代理时如何借鉴 OpenAI 的安全思路?
核心是建立持续对抗测试机制:一、识别代理可能接触的所有非可信内容源(邮件、文档、第三方 API 返回等);二、模拟攻击者视角构造注入样本,测试代理是否会偏离用户指令;三、对高权限操作(转账、删除文件、发送邮件)设置二次确认或沙盒验证;四、定期更新防御模型,而非一次性安全审计。若资源有限,可优先加固涉及敏感数据和高权限操作的代理功能。
提示词注入问题能彻底解决吗?
根据 OpenAI 的表述,提示词注入是'长期 AI 安全挑战',预计需持续多年攻防。类似传统网络安全中的钓鱼攻击,攻击手法会不断演变,防御也需持续迭代。目前业界尚无'一劳永逸'的解决方案,但通过对抗训练、多层防护、持续红队测试等手段,可显著提高攻击成本和难度,将风险降至可接受水平。
[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

谷歌推出 Google Pics 图像生成编辑工具并集成至 Workspace

谷歌推出 Google Pics 图像生成编辑工具并集成至 Workspace

谷歌宣布面向 Google AI Pro/Ultra 订阅用户及多数 Workspace 企业客户推出 Google Pics,这是一款基于 Nano Banana 模型的图像生成与编辑工具。该产品既可独立使用,也将集成到 Docs、Slides 和 Drive 中,支持对象分割、图内文字编辑翻译、多人协作等功能,让用户无需跨应用切换即可完成图像创作。

模型与产品谷歌
OpenAI 停止向 Cursor 提供模型服务 马斯克与奥特曼争端升级

OpenAI 停止向 Cursor 提供模型服务 马斯克与奥特曼争端升级

OpenAI 宣布将停止向编程工具 Cursor 提供 AI 模型,理由是 Cursor 现归属马斯克的 SpaceX,而 OpenAI 担忧 SpaceX 违反服务条款。这是 OpenAI CEO 奥特曼与联合创始人马斯克多年公开争端的最新一幕。Anthropic 已表态将增加算力支持 Cursor 转用 Claude 模型。

行业动态OpenAI
Codex 四个月实践:从写作者到 Mac 应用开发者的 AI 辅助之旅

Codex 四个月实践:从写作者到 Mac 应用开发者的 AI 辅助之旅

9to5Mac 编辑分享了使用 OpenAI Codex 四个月的实践经验。作为非程序员的写作者,他通过 ChatGPT 桌面版的 Codex 功能和 Computer Use 插件,从零开始构建了多个个性化 Mac 应用,包括应用更新监控工具 Flow、社交媒体客户端等。文章揭示了 AI 编程助手如何降低开发门槛,让普通用户也能为特定需求定制软件工具。

应用与案例OpenAI
OpenAI 密歇根数据中心项目累计工时破百万 安全记录零事故

OpenAI 密歇根数据中心项目累计工时破百万 安全记录零事故

OpenAI 在密歇根州安娜堡市南部的数据中心项目达成 100 万工时无损失工时伤害的安全里程碑。该项目由 OpenAI 与基础设施公司 Continuum 合作建设,仍在施工中,预计将为当地带来数百个就业岗位,用于支撑包括 ChatGPT 在内的 AI 模型算力需求。

行业动态OpenAI