智譜 AI 釋出 GLM-5.3 模型,網路安全測試成績超越 Anthropic Mythos 5
中國 AI 公司智譜 AI(Z.ai)推出旗艦模型 GLM-5.3,在程式碼安全漏洞識別基準 CyberGym 上得分 84.5%,超過 Anthropic Mythos 5 的 83.8% 和 OpenAI GPT-5.6 Sol 的 83.6%。該模型已在國內安全團隊真實程式碼庫中測試,發現 2436 個漏洞,其中 1097 個為中高危級別。智譜計劃兩週內公開發布,但核心安全功能僅向認證使用者開放。

中國 AI 公司智譜 AI(Zhipu/Z.ai)最近放大招,推出旗艦模型 GLM-5.3,還曬出一組亮眼的網路安全測試成績:在程式碼安全漏洞識別基準 CyberGym 上,GLM-5.3 得分 84.5%,直接幹翻 Anthropic 的 Mythos 5(83.8%)和 OpenAI 的 GPT-5.6 Sol(83.6%)。這波操作不僅秀了中國 AI 廠商在網路安全防禦技術上的肌肉,還剛好趕上中美在 AI 安全能力上掰手腕的關鍵時刻。
測試成績:防守穩如狗,進攻有點菜
CyberGym 是專門測 AI 模型從原始碼裡抓漏洞能力的基準。GLM-5.3 在這項測試中拔得頭籌,說明它在程式碼審計、漏洞掃描這些防守活兒上確實有兩把刷子。
不過,另一項測試 ExploitBench(測 AI 模型搞破壞的能力)就有點尷尬了,GLM-5.3 只拿了 54.4%,明顯掉隊。這暴露出它在攻擊性安全研究(比如漏洞利用、滲透測試)方面還是短板,攻防兩端還不太平衡。
實戰檢驗:揪出 2400+ 漏洞
智譜 AI 還透露,GLM-5.3 已經和國內安全團隊聯手,在真實程式碼庫上打了一場硬仗。經過專家稽核,這模型在 269 個專案中一口氣找出 2,436 個漏洞,其中 1,097 個被定為中高危級別。這資料不僅證明了模型在實際軟體系統安全審查中的實力,對開源專案維護者和中小安全團隊來說,也是個不小的參考。
釋出計劃:搞個"可信訪問"機制
智譜 AI 宣佈,兩週內 GLM-5.3 就會正式上線,但在這之前會先搞定安全評估,加強防護措施。重點是,這模型最敏感的網路安全功能只對認證使用者開放,搞了個"可信訪問"(trusted access)機制。
這套路既符合中國對生成式 AI 安全管理的監管要求,也體現了業界對"雙刃劍"工具的謹慎態度——強大的漏洞識別能力要是被濫用,分分鐘變成攻擊利器。智譜希望通過認證機制,把高階網路防禦能力優先給開源軟體開發者和小型安全團隊,在安全與開放之間找個平衡點。
中國視角:垂直能力突破 + 合規挑戰
對中國 AI 從業者來說,GLM-5.3 的釋出有兩層意思:一是除了通用大模型,垂直領域能力(比如網路安全)正成為國內廠商的新戰場;二是"可信訪問"等機制的落地,意味著安全類 AI 工具的合規運營將成為行業標配。開發者用這類模型時,不光要關注技術能力,還得留意訪問許可權的申請流程。
常見問題
GLM-5.3 在哪些安全任務上表現更好?
根據測試資料,GLM-5.3 在程式碼漏洞識別和驗證(CyberGym 基準)上表現優異,得分 84.5%,適合程式碼審計、安全掃描等防禦性任務。但在漏洞利用能力(ExploitBench)上僅 54.4%,攻擊性安全研究能力相對較弱。
普通開發者能直接使用 GLM-5.3 的安全功能嗎?
智譜 AI 將採用'可信訪問'機制,核心網路安全功能僅向認證使用者開放。開源軟體開發者和小型安全團隊是優先服務物件,具體申請流程需等待正式釋出後公佈。
GLM-5.3 發現的 2436 個漏洞可信度如何?
這些漏洞是在 269 個真實專案中由模型識別、經專家稽核後確認的,其中 1097 個被評為中高危級別。專家稽核環節降低了誤報風險,但實際應用中仍建議結合人工複核。
這次測試對比的 Mythos 5 和 GPT-5.6 Sol 是什麼?
Mythos 5 是 Anthropic 的前沿模型(原文稱 frontier model),GPT-5.6 Sol 疑似為 OpenAI 的某個測試版本或變體。由於原文未提供詳細背景,建議以 CyberGym 官方排行榜為準核對具體模型版本。
本文基於 GNews:NewsBytes 報道, 由 AiDuo123 AI 編輯翻譯改寫。原文連結: https://www.newsbytesapp.com/news/science/zhipu-claims-its-ai-model-beats-mythos-5-in-cybersecurity/story
相关 AI 工具
文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾
Midjourney
精选AI 绘图
頂級 AI 影像生成工具,以畫面質感、藝術風格、構圖理解著稱。V7 模型在寫實和創意兩個方向均領先。需 Discord 或網頁版使用。
Cursor
精选AI 开发工具
AI-first 程式碼編輯器,基於 VS Code 構建,深度整合 Claude / GPT-4o 等模型。Composer 多檔案編輯、Tab 自動補全、Agent 模式三大殺手鐧。
Claude
精选大模型应用
Anthropic 推出的 AI 助手,以長上下文(200K tokens)、對複雜任務的細膩理解、Artifacts 視覺化輸出聞名。Claude Sonnet 4.5 / Opus 4.7 在程式設計、寫作、推理多項基準上領先。
相关推荐
同类资讯 — 由发布时间排序

美國父母藉助 ChatGPT 協助診斷女兒罕見病:AI 醫療應用的真實案例
一位生物技術行業從業者母親在醫生未能確診女兒反覆生病原因時,將孩子的症狀和實驗室檢測資料輸入 ChatGPT,AI 在數秒內給出可能的免疫缺陷診斷方向。這一案例折射出 AI 聊天機器人在醫療諮詢中的快速普及——美國四分之一人口已用其診斷症狀,但專家強調需謹慎使用並注意隱私與準確性風險。

Windows 11 最新更新破壞 WSL 與 Claude Cowork 功能
微軟確認 Windows 11 九月安全更新 KB5124008 導致基於 Hyper-V 的 Linux 虛擬機器中 Plan9 主機資料夾共享失效,直接影響 WSL 和 Claude Cowork 無法讀取共享資料夾,應用可能顯示"未掛載 Plan9 驅動器共享"錯誤。微軟已將其列為已知問題並正在修復,但暫無補丁或臨時解決方案。

Anthropic工程師警告AI或致人類滅絕 為何仍加速開發
Anthropic研究員Jacob Coxon因擔憂遞迴自我改進AI系統的風險而辭職,該公司安全主管隨後表示確信AI可能導致人類滅絕機率超10%。儘管以安全為使命,Anthropic仍在推進自主智慧體開發並籌備估值2萬億美元IPO,其"謹慎推進反而更危險"的邏輯引發爭議。

Meta 因 AI 訓練資料與人臉識別系統遭集體訴訟
美國伊利諾州和加州的多名使用者向 Meta 提起集體訴訟,指控其未經同意使用 Facebook 和 Instagram 照片訓練未釋出的人臉識別系統 NameTag 及生成式 AI 模型 Emu 和 Muse Image,違反州生物識別隱私法。訴訟索賠金額可能達數十億美元,這是 Meta 繼 2020 年和 2024 年生物識別資料和解案後再次面臨重大隱私訴訟。