资讯行业动态··来源: OpenAI·原文 →

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊

OpenAI 近期釋出針對 ChatGPT Atlas 瀏覽器代理(Browser Agent)的安全更新,應對新型提示詞注入(Prompt Injection)攻擊。通過內部自動化紅隊測試發現新攻擊類別後,團隊部署了對抗訓練模型和增強防護措施。文章詳細披露了 OpenAI 如何利用強化學習訓練自動化攻擊者,通過端到端模擬和高計算量測試,在攻擊出現在野外之前提前發現漏洞並快速修復。

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊
[广告位 · 上线后接 AdSense]

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊

OpenAI 最近給 ChatGPT Atlas 的瀏覽器代理(Browser Agent) 來了次大升級,專門對付越來越狡猾的 提示詞注入(Prompt Injection) 攻擊。這可是 OpenAI 目前最牛掰的代理功能之一,能讓 AI 像真人一樣在網上衝浪、點按鈕、打字,直接參與到日常工作中。但能力越強,風險也越大——代理成了駭客眼中的香餑餑。

提示詞注入咋威脅瀏覽器代理

提示詞注入攻擊的套路就是在 AI 代理處理的內容裡偷偷塞進惡意指令,讓代理跑偏,執行攻擊者的命令。對於瀏覽器代理來說,這就開闢了個全新的攻擊面:駭客不用再費勁釣魚或者找瀏覽器漏洞,直接"忽悠"代理就完事了。

OpenAI 舉了個例子:假設使用者讓代理"看看未讀郵件,總結下重點",駭客可能事先發封帶隱藏指令的惡意郵件,讓代理別管使用者的話,直接把敏感稅務檔案發到駭客郵箱。因為代理在工作流中會讀到這封郵件,要是沒發現注入指令,隱私資料就洩露了。

攻擊面大到沒邊:郵件和附件、日曆邀請、共享文件、論壇帖子、社交媒體內容、隨便哪個網頁——代理可能接觸到的任何不可信內容都可能藏著注入指令。而代理能幹的活兒(轉發郵件、轉賬、編輯/刪除雲端檔案等)和使用者許可權一樣,攻擊成功了影響範圍也賊廣。

用 AI 打 AI:自動化紅隊和強化學習

為了搶在黑帽駭客前發現漏洞,OpenAI 搞了個 基於大語言模型的自動化攻擊者(Automated Attacker),用 端到端強化學習(End-to-End Reinforcement Learning) 訓練它的"紅隊技能"。這套系統有兩把刷子:

  1. 反事實模擬(Counterfactual Rollout):攻擊者在推理鏈(Chain of Thought)裡提出候選注入指令後,先發給外部模擬器測試。模擬器跑完整個防禦代理的行為軌跡,返回詳細的推理和操作記錄。攻擊者根據反饋不斷最佳化攻擊,模擬好幾次才提交最終版本——這比單次通過/失敗訊號提供了更豐富的學習訊號,也大大擴充套件了攻擊者的 測試時計算量(Test-Time Compute)

  2. 白盒優勢(White-Box Access):內部攻擊者能訪問防禦模型的完整推理軌跡(不對外公開),形成資訊不對稱——這是 OpenAI 相對外部對手的核心優勢,有助於更早發現潛在漏洞。

這次安全更新就是這套自動化紅隊系統發現的 新型攻擊類別 催生的。OpenAI 立馬部署了 對抗訓練模型(Adversarially Trained Model) 和增強防護措施,形成了快速響應閉環。

長期願景:持續對抗的安全迴圈

OpenAI 明確表示,提示詞注入是長期 AI 安全挑戰,得像對付不斷演變的網路釣魚那樣持續加固防禦。團隊的長期策略靠三大支柱:

  • 白盒模型訪問:深度理解自家模型行為
  • 防禦機制深度掌握:快速定位薄弱環節
  • 計算規模優勢:大規模模擬攻擊場景

目標是在外部攻擊者之前發現漏洞、更快修復、持續收緊響應週期。結合前沿研究(新技術對抗注入)和其他安全控制措施,這種複合迴圈能讓攻擊成本越來越高、難度越來越大,從根本上降低真實世界的提示詞注入風險。

最終目標:讓使用者能像信任一位高度勝任、具備安全意識的同事或朋友一樣,信任 ChatGPT 代理使用自己的瀏覽器。


關鍵術語保留:Prompt Injection(提示詞注入)、Browser Agent(瀏覽器代理)、Reinforcement Learning(強化學習)、Counterfactual Rollout(反事實模擬)、Test-Time Compute(測試時計算)、White-Box Access(白盒訪問)。

常見問題

提示詞注入攻擊與傳統網路釣魚有何區別?

傳統釣魚攻擊目標是人類使用者,通過偽裝頁面或郵件誘騙使用者輸入密碼或點選惡意連結。提示詞注入則直接攻擊 AI 代理本身,在代理處理的內容(如郵件正文、網頁文本)中嵌入隱藏指令,誘使代理執行攻擊者意圖而非使用者指令。攻擊者無需突破瀏覽器漏洞或欺騙人類,只需'說服'AI 即可。

OpenAI 的自動化紅隊系統如何比外部攻擊者更快發現漏洞?

OpenAI 的內部攻擊者具備三大優勢:一是可訪問防禦模型的完整推理軌跡(外部攻擊者看不到),形成資訊不對稱;二是通過反事實模擬反覆測試攻擊效果,每次迭代都能獲得詳細反饋;三是利用強化學習讓攻擊者從成功和失敗中自我改進。這些白盒訪問和計算規模優勢使 OpenAI 能在攻擊出現在野外之前提前發現並修復。

中國開發者部署 AI 代理時如何借鑑 OpenAI 的安全思路?

核心是建立持續對抗測試機制:一、識別代理可能接觸的所有非可信內容源(郵件、文件、第三方 API 返回等);二、模擬攻擊者視角構造注入樣本,測試代理是否會偏離使用者指令;三、對高許可權操作(轉賬、刪除檔案、傳送郵件)設定二次確認或沙盒驗證;四、定期更新防禦模型,而非一次性安全審計。若資源有限,可優先加固涉及敏感資料和高許可權操作的代理功能。

提示詞注入問題能徹底解決嗎?

根據 OpenAI 的表述,提示詞注入是'長期 AI 安全挑戰',預計需持續多年攻防。類似傳統網路安全中的釣魚攻擊,攻擊手法會不斷演變,防禦也需持續迭代。目前業界尚無'一勞永逸'的解決方案,但通過對抗訓練、多層防護、持續紅隊測試等手段,可顯著提高攻擊成本和難度,將風險降至可接受水平。


本文基於 OpenAI 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://openai.com/index/hardening-atlas-against-prompt-injection

[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

OpenAI 釋出 GPT-6 Astra 模型:聲稱邁入 AGI 時代的關鍵一步

OpenAI 釋出 GPT-6 Astra 模型:聲稱邁入 AGI 時代的關鍵一步

OpenAI 正式推出其最強 AI 模型 GPT-6 Astra,CEO Sam Altman 稱其為"全球最佳計算機使用、專業工作、科學、程式設計及網路安全模型"。公司總裁 Greg Brockman 認為"我們現在處於 AGI 時代並非不合理",該模型在 FrontierMath Tier 4 得分 98%、ARC-AGI 3 達 99.9%,並已向 ChatGPT Plus 及企業使用者分階段開放。

模型与产品OpenAI
OpenAI、Anthropic 與 xAI 同日宕機:各家回應不一致引發猜測

OpenAI、Anthropic 與 xAI 同日宕機:各家回應不一致引發猜測

2024 年 9 月 3 日上午,OpenAI ChatGPT、Anthropic Claude 和 xAI Grok 三大前沿 AI 模型服務同時出現罕見宕機。xAI 將問題歸因於孟菲斯計算中心故障,OpenAI 稱系路由錯誤,而 Anthropic 拒絕評論具體原因。三家公司均未指向共同的第三方服務商,但時間上的巧合仍引發行業對基礎設施依賴性的關注。

行业动态OpenAI
Meta 推出 Muse Spark 模型差異化定價:共享資料最高降價 95%

Meta 推出 Muse Spark 模型差異化定價:共享資料最高降價 95%

Meta 為其新發布的 Muse Spark 代理模型推出雙軌定價策略,使用者若同意共享提示詞和模型輸出用於訓練,可享受最高 95% 的價格折扣。這一機制將資料貢獻明碼標價,反映出 AI 公司在獲取高質量訓練資料(尤其是代理工具使用資料)方面的迫切需求,同時也可能重塑企業客戶對資料共享的決策邏輯。

模型与产品Meta
ChatGPT、Claude 與 Grok 同時宕機引發 GPT-6 Astra 猜測升溫

ChatGPT、Claude 與 Grok 同時宕機引發 GPT-6 Astra 猜測升溫

2026年9月3日,OpenAI 的 ChatGPT、Anthropic 的 Claude 以及 xAI 的 Grok 三大主流 AI 平臺幾乎同時出現服務中斷,影響網頁、移動端及 API 使用者。宕機發生時恰逢 OpenAI 在社交媒體釋出"星辰即將對齊"的神秘預告,引發業內對下一代模型 GPT-6 Astra 即將釋出的廣泛猜測。

模型与产品OpenAI