资讯行业动态··来源: OpenAI·原文 →

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊

OpenAI 近期釋出針對 ChatGPT Atlas 瀏覽器代理(Browser Agent)的安全更新,應對新型提示詞注入(Prompt Injection)攻擊。通過內部自動化紅隊測試發現新攻擊類別後,團隊部署了對抗訓練模型和增強防護措施。文章詳細披露了 OpenAI 如何利用強化學習訓練自動化攻擊者,通過端到端模擬和高計算量測試,在攻擊出現在野外之前提前發現漏洞並快速修復。

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊
[广告位 · 上线后接 AdSense]

OpenAI 強化 ChatGPT Atlas 瀏覽器代理防禦提示詞注入攻擊

OpenAI 最近給 ChatGPT Atlas 的瀏覽器代理(Browser Agent) 來了次大升級,專門對付越來越狡猾的 提示詞注入(Prompt Injection) 攻擊。這可是 OpenAI 目前最牛掰的代理功能之一,能讓 AI 像真人一樣在網上衝浪、點按鈕、打字,直接參與到日常工作中。但能力越強,風險也越大——代理成了駭客眼中的香餑餑。

提示詞注入咋威脅瀏覽器代理

提示詞注入攻擊的套路就是在 AI 代理處理的內容裡偷偷塞進惡意指令,讓代理跑偏,執行攻擊者的命令。對於瀏覽器代理來說,這就開闢了個全新的攻擊面:駭客不用再費勁釣魚或者找瀏覽器漏洞,直接"忽悠"代理就完事了。

OpenAI 舉了個例子:假設使用者讓代理"看看未讀郵件,總結下重點",駭客可能事先發封帶隱藏指令的惡意郵件,讓代理別管使用者的話,直接把敏感稅務檔案發到駭客郵箱。因為代理在工作流中會讀到這封郵件,要是沒發現注入指令,隱私資料就洩露了。

攻擊面大到沒邊:郵件和附件、日曆邀請、共享文件、論壇帖子、社交媒體內容、隨便哪個網頁——代理可能接觸到的任何不可信內容都可能藏著注入指令。而代理能幹的活兒(轉發郵件、轉賬、編輯/刪除雲端檔案等)和使用者許可權一樣,攻擊成功了影響範圍也賊廣。

用 AI 打 AI:自動化紅隊和強化學習

為了搶在黑帽駭客前發現漏洞,OpenAI 搞了個 基於大語言模型的自動化攻擊者(Automated Attacker),用 端到端強化學習(End-to-End Reinforcement Learning) 訓練它的"紅隊技能"。這套系統有兩把刷子:

  1. 反事實模擬(Counterfactual Rollout):攻擊者在推理鏈(Chain of Thought)裡提出候選注入指令後,先發給外部模擬器測試。模擬器跑完整個防禦代理的行為軌跡,返回詳細的推理和操作記錄。攻擊者根據反饋不斷最佳化攻擊,模擬好幾次才提交最終版本——這比單次通過/失敗訊號提供了更豐富的學習訊號,也大大擴充套件了攻擊者的 測試時計算量(Test-Time Compute)

  2. 白盒優勢(White-Box Access):內部攻擊者能訪問防禦模型的完整推理軌跡(不對外公開),形成資訊不對稱——這是 OpenAI 相對外部對手的核心優勢,有助於更早發現潛在漏洞。

這次安全更新就是這套自動化紅隊系統發現的 新型攻擊類別 催生的。OpenAI 立馬部署了 對抗訓練模型(Adversarially Trained Model) 和增強防護措施,形成了快速響應閉環。

長期願景:持續對抗的安全迴圈

OpenAI 明確表示,提示詞注入是長期 AI 安全挑戰,得像對付不斷演變的網路釣魚那樣持續加固防禦。團隊的長期策略靠三大支柱:

  • 白盒模型訪問:深度理解自家模型行為
  • 防禦機制深度掌握:快速定位薄弱環節
  • 計算規模優勢:大規模模擬攻擊場景

目標是在外部攻擊者之前發現漏洞、更快修復、持續收緊響應週期。結合前沿研究(新技術對抗注入)和其他安全控制措施,這種複合迴圈能讓攻擊成本越來越高、難度越來越大,從根本上降低真實世界的提示詞注入風險。

最終目標:讓使用者能像信任一位高度勝任、具備安全意識的同事或朋友一樣,信任 ChatGPT 代理使用自己的瀏覽器。


關鍵術語保留:Prompt Injection(提示詞注入)、Browser Agent(瀏覽器代理)、Reinforcement Learning(強化學習)、Counterfactual Rollout(反事實模擬)、Test-Time Compute(測試時計算)、White-Box Access(白盒訪問)。

常見問題

提示詞注入攻擊與傳統網路釣魚有何區別?

傳統釣魚攻擊目標是人類使用者,通過偽裝頁面或郵件誘騙使用者輸入密碼或點選惡意連結。提示詞注入則直接攻擊 AI 代理本身,在代理處理的內容(如郵件正文、網頁文本)中嵌入隱藏指令,誘使代理執行攻擊者意圖而非使用者指令。攻擊者無需突破瀏覽器漏洞或欺騙人類,只需'說服'AI 即可。

OpenAI 的自動化紅隊系統如何比外部攻擊者更快發現漏洞?

OpenAI 的內部攻擊者具備三大優勢:一是可訪問防禦模型的完整推理軌跡(外部攻擊者看不到),形成資訊不對稱;二是通過反事實模擬反覆測試攻擊效果,每次迭代都能獲得詳細反饋;三是利用強化學習讓攻擊者從成功和失敗中自我改進。這些白盒訪問和計算規模優勢使 OpenAI 能在攻擊出現在野外之前提前發現並修復。

中國開發者部署 AI 代理時如何借鑑 OpenAI 的安全思路?

核心是建立持續對抗測試機制:一、識別代理可能接觸的所有非可信內容源(郵件、文件、第三方 API 返回等);二、模擬攻擊者視角構造注入樣本,測試代理是否會偏離使用者指令;三、對高許可權操作(轉賬、刪除檔案、傳送郵件)設定二次確認或沙盒驗證;四、定期更新防禦模型,而非一次性安全審計。若資源有限,可優先加固涉及敏感資料和高許可權操作的代理功能。

提示詞注入問題能徹底解決嗎?

根據 OpenAI 的表述,提示詞注入是'長期 AI 安全挑戰',預計需持續多年攻防。類似傳統網路安全中的釣魚攻擊,攻擊手法會不斷演變,防禦也需持續迭代。目前業界尚無'一勞永逸'的解決方案,但通過對抗訓練、多層防護、持續紅隊測試等手段,可顯著提高攻擊成本和難度,將風險降至可接受水平。


本文基於 OpenAI 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://openai.com/index/hardening-atlas-against-prompt-injection

[广告位 · 上线后接 AdSense]
标签:#OpenAI

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

美國父母藉助 ChatGPT 協助診斷女兒罕見病:AI 醫療應用的真實案例

美國父母藉助 ChatGPT 協助診斷女兒罕見病:AI 醫療應用的真實案例

一位生物技術行業從業者母親在醫生未能確診女兒反覆生病原因時,將孩子的症狀和實驗室檢測資料輸入 ChatGPT,AI 在數秒內給出可能的免疫缺陷診斷方向。這一案例折射出 AI 聊天機器人在醫療諮詢中的快速普及——美國四分之一人口已用其診斷症狀,但專家強調需謹慎使用並注意隱私與準確性風險。

应用与案例OpenAI
Windows 11 最新更新破壞 WSL 與 Claude Cowork 功能

Windows 11 最新更新破壞 WSL 與 Claude Cowork 功能

微軟確認 Windows 11 九月安全更新 KB5124008 導致基於 Hyper-V 的 Linux 虛擬機器中 Plan9 主機資料夾共享失效,直接影響 WSL 和 Claude Cowork 無法讀取共享資料夾,應用可能顯示"未掛載 Plan9 驅動器共享"錯誤。微軟已將其列為已知問題並正在修復,但暫無補丁或臨時解決方案。

行业动态微软
Anthropic工程師警告AI或致人類滅絕 為何仍加速開發

Anthropic工程師警告AI或致人類滅絕 為何仍加速開發

Anthropic研究員Jacob Coxon因擔憂遞迴自我改進AI系統的風險而辭職,該公司安全主管隨後表示確信AI可能導致人類滅絕機率超10%。儘管以安全為使命,Anthropic仍在推進自主智慧體開發並籌備估值2萬億美元IPO,其"謹慎推進反而更危險"的邏輯引發爭議。

行业动态Anthropic
Meta 因 AI 訓練資料與人臉識別系統遭集體訴訟

Meta 因 AI 訓練資料與人臉識別系統遭集體訴訟

美國伊利諾州和加州的多名使用者向 Meta 提起集體訴訟,指控其未經同意使用 Facebook 和 Instagram 照片訓練未釋出的人臉識別系統 NameTag 及生成式 AI 模型 Emu 和 Muse Image,違反州生物識別隱私法。訴訟索賠金額可能達數十億美元,這是 Meta 繼 2020 年和 2024 年生物識別資料和解案後再次面臨重大隱私訴訟。

政策与安全Meta