资讯模型与产品··来源: Newsbytesapp·原文 →

智譜 AI 釋出 GLM-5.3 模型,網路安全測試成績超越 Anthropic Mythos 5

中國 AI 公司智譜 AI(Z.ai)推出旗艦模型 GLM-5.3,在程式碼安全漏洞識別基準 CyberGym 上得分 84.5%,超過 Anthropic Mythos 5 的 83.8% 和 OpenAI GPT-5.6 Sol 的 83.6%。該模型已在國內安全團隊真實程式碼庫中測試,發現 2436 個漏洞,其中 1097 個為中高危級別。智譜計劃兩週內公開發布,但核心安全功能僅向認證使用者開放。

智譜 AI 釋出 GLM-5.3 模型,網路安全測試成績超越 Anthropic Mythos 5
[广告位 · 上线后接 AdSense]

中國 AI 公司智譜 AI(Zhipu/Z.ai)最近放大招,推出旗艦模型 GLM-5.3,還曬出一組亮眼的網路安全測試成績:在程式碼安全漏洞識別基準 CyberGym 上,GLM-5.3 得分 84.5%,直接幹翻 Anthropic 的 Mythos 5(83.8%)和 OpenAI 的 GPT-5.6 Sol(83.6%)。這波操作不僅秀了中國 AI 廠商在網路安全防禦技術上的肌肉,還剛好趕上中美在 AI 安全能力上掰手腕的關鍵時刻。

測試成績:防守穩如狗,進攻有點菜

CyberGym 是專門測 AI 模型從原始碼裡抓漏洞能力的基準。GLM-5.3 在這項測試中拔得頭籌,說明它在程式碼審計、漏洞掃描這些防守活兒上確實有兩把刷子。

不過,另一項測試 ExploitBench(測 AI 模型搞破壞的能力)就有點尷尬了,GLM-5.3 只拿了 54.4%,明顯掉隊。這暴露出它在攻擊性安全研究(比如漏洞利用、滲透測試)方面還是短板,攻防兩端還不太平衡。

實戰檢驗:揪出 2400+ 漏洞

智譜 AI 還透露,GLM-5.3 已經和國內安全團隊聯手,在真實程式碼庫上打了一場硬仗。經過專家稽核,這模型在 269 個專案中一口氣找出 2,436 個漏洞,其中 1,097 個被定為中高危級別。這資料不僅證明了模型在實際軟體系統安全審查中的實力,對開源專案維護者和中小安全團隊來說,也是個不小的參考。

釋出計劃:搞個"可信訪問"機制

智譜 AI 宣佈,兩週內 GLM-5.3 就會正式上線,但在這之前會先搞定安全評估,加強防護措施。重點是,這模型最敏感的網路安全功能只對認證使用者開放,搞了個"可信訪問"(trusted access)機制。

這套路既符合中國對生成式 AI 安全管理的監管要求,也體現了業界對"雙刃劍"工具的謹慎態度——強大的漏洞識別能力要是被濫用,分分鐘變成攻擊利器。智譜希望通過認證機制,把高階網路防禦能力優先給開源軟體開發者小型安全團隊,在安全與開放之間找個平衡點。

中國視角:垂直能力突破 + 合規挑戰

對中國 AI 從業者來說,GLM-5.3 的釋出有兩層意思:一是除了通用大模型,垂直領域能力(比如網路安全)正成為國內廠商的新戰場;二是"可信訪問"等機制的落地,意味著安全類 AI 工具的合規運營將成為行業標配。開發者用這類模型時,不光要關注技術能力,還得留意訪問許可權的申請流程。

常見問題

GLM-5.3 在哪些安全任務上表現更好?

根據測試資料,GLM-5.3 在程式碼漏洞識別和驗證(CyberGym 基準)上表現優異,得分 84.5%,適合程式碼審計、安全掃描等防禦性任務。但在漏洞利用能力(ExploitBench)上僅 54.4%,攻擊性安全研究能力相對較弱。

普通開發者能直接使用 GLM-5.3 的安全功能嗎?

智譜 AI 將採用'可信訪問'機制,核心網路安全功能僅向認證使用者開放。開源軟體開發者和小型安全團隊是優先服務物件,具體申請流程需等待正式釋出後公佈。

GLM-5.3 發現的 2436 個漏洞可信度如何?

這些漏洞是在 269 個真實專案中由模型識別、經專家稽核後確認的,其中 1097 個被評為中高危級別。專家稽核環節降低了誤報風險,但實際應用中仍建議結合人工複核。

這次測試對比的 Mythos 5 和 GPT-5.6 Sol 是什麼?

Mythos 5 是 Anthropic 的前沿模型(原文稱 frontier model),GPT-5.6 Sol 疑似為 OpenAI 的某個測試版本或變體。由於原文未提供詳細背景,建議以 CyberGym 官方排行榜為準核對具體模型版本。


本文基於 GNews:NewsBytes 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://www.newsbytesapp.com/news/science/zhipu-claims-its-ai-model-beats-mythos-5-in-cybersecurity/story

[广告位 · 上线后接 AdSense]
标签:#Anthropic

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

OpenAI 釋出 GPT-6 Astra 模型:聲稱邁入 AGI 時代的關鍵一步

OpenAI 釋出 GPT-6 Astra 模型:聲稱邁入 AGI 時代的關鍵一步

OpenAI 正式推出其最強 AI 模型 GPT-6 Astra,CEO Sam Altman 稱其為"全球最佳計算機使用、專業工作、科學、程式設計及網路安全模型"。公司總裁 Greg Brockman 認為"我們現在處於 AGI 時代並非不合理",該模型在 FrontierMath Tier 4 得分 98%、ARC-AGI 3 達 99.9%,並已向 ChatGPT Plus 及企業使用者分階段開放。

模型与产品OpenAI
OpenAI、Anthropic 與 xAI 同日宕機:各家回應不一致引發猜測

OpenAI、Anthropic 與 xAI 同日宕機:各家回應不一致引發猜測

2024 年 9 月 3 日上午,OpenAI ChatGPT、Anthropic Claude 和 xAI Grok 三大前沿 AI 模型服務同時出現罕見宕機。xAI 將問題歸因於孟菲斯計算中心故障,OpenAI 稱系路由錯誤,而 Anthropic 拒絕評論具體原因。三家公司均未指向共同的第三方服務商,但時間上的巧合仍引發行業對基礎設施依賴性的關注。

行业动态OpenAI
Meta 推出 Muse Spark 模型差異化定價:共享資料最高降價 95%

Meta 推出 Muse Spark 模型差異化定價:共享資料最高降價 95%

Meta 為其新發布的 Muse Spark 代理模型推出雙軌定價策略,使用者若同意共享提示詞和模型輸出用於訓練,可享受最高 95% 的價格折扣。這一機制將資料貢獻明碼標價,反映出 AI 公司在獲取高質量訓練資料(尤其是代理工具使用資料)方面的迫切需求,同時也可能重塑企業客戶對資料共享的決策邏輯。

模型与产品Meta
ChatGPT、Claude 與 Grok 同時宕機引發 GPT-6 Astra 猜測升溫

ChatGPT、Claude 與 Grok 同時宕機引發 GPT-6 Astra 猜測升溫

2026年9月3日,OpenAI 的 ChatGPT、Anthropic 的 Claude 以及 xAI 的 Grok 三大主流 AI 平臺幾乎同時出現服務中斷,影響網頁、移動端及 API 使用者。宕機發生時恰逢 OpenAI 在社交媒體釋出"星辰即將對齊"的神秘預告,引發業內對下一代模型 GPT-6 Astra 即將釋出的廣泛猜測。

模型与产品OpenAI