资讯模型与产品··来源: Newsbytesapp·原文 →

智谱 AI 发布 GLM-5.3 模型,网络安全测试成绩超越 Anthropic Mythos 5

中国 AI 公司智谱 AI(Z.ai)推出旗舰模型 GLM-5.3,在代码安全漏洞识别基准 CyberGym 上得分 84.5%,超过 Anthropic Mythos 5 的 83.8% 和 OpenAI GPT-5.6 Sol 的 83.6%。该模型已在国内安全团队真实代码库中测试,发现 2436 个漏洞,其中 1097 个为中高危级别。智谱计划两周内公开发布,但核心安全功能仅向认证用户开放。

智谱 AI 发布 GLM-5.3 模型,网络安全测试成绩超越 Anthropic Mythos 5
[广告位 · 上线后接 AdSense]

中国 AI 公司智谱 AI(Zhipu/Z.ai)最近放大招,推出旗舰模型 GLM-5.3,还晒出一组亮眼的网络安全测试成绩:在代码安全漏洞识别基准 CyberGym 上,GLM-5.3 得分 84.5%,直接干翻 Anthropic 的 Mythos 5(83.8%)和 OpenAI 的 GPT-5.6 Sol(83.6%)。这波操作不仅秀了中国 AI 厂商在网络安全防御技术上的肌肉,还刚好赶上中美在 AI 安全能力上掰手腕的关键时刻。

测试成绩:防守稳如狗,进攻有点菜

CyberGym 是专门测 AI 模型从源代码里抓漏洞能力的基准。GLM-5.3 在这项测试中拔得头筹,说明它在代码审计、漏洞扫描这些防守活儿上确实有两把刷子。

不过,另一项测试 ExploitBench(测 AI 模型搞破坏的能力)就有点尴尬了,GLM-5.3 只拿了 54.4%,明显掉队。这暴露出它在攻击性安全研究(比如漏洞利用、渗透测试)方面还是短板,攻防两端还不太平衡。

实战检验:揪出 2400+ 漏洞

智谱 AI 还透露,GLM-5.3 已经和国内安全团队联手,在真实代码库上打了一场硬仗。经过专家审核,这模型在 269 个项目中一口气找出 2,436 个漏洞,其中 1,097 个被定为中高危级别。这数据不仅证明了模型在实际软件系统安全审查中的实力,对开源项目维护者和中小安全团队来说,也是个不小的参考。

发布计划:搞个"可信访问"机制

智谱 AI 宣布,两周内 GLM-5.3 就会正式上线,但在这之前会先搞定安全评估,加强防护措施。重点是,这模型最敏感的网络安全功能只对认证用户开放,搞了个"可信访问"(trusted access)机制。

这套路既符合中国对生成式 AI 安全管理的监管要求,也体现了业界对"双刃剑"工具的谨慎态度——强大的漏洞识别能力要是被滥用,分分钟变成攻击利器。智谱希望通过认证机制,把高级网络防御能力优先给开源软件开发者小型安全团队,在安全与开放之间找个平衡点。

中国视角:垂直能力突破 + 合规挑战

对中国 AI 从业者来说,GLM-5.3 的发布有两层意思:一是除了通用大模型,垂直领域能力(比如网络安全)正成为国内厂商的新战场;二是"可信访问"等机制的落地,意味着安全类 AI 工具的合规运营将成为行业标配。开发者用这类模型时,不光要关注技术能力,还得留意访问权限的申请流程。


本文基于 GNews:NewsBytes 报道, 由 AiDuo123 AI 编辑翻译改写。原文链接: https://www.newsbytesapp.com/news/science/zhipu-claims-its-ai-model-beats-mythos-5-in-cybersecurity/story

常见问题

GLM-5.3 在哪些安全任务上表现更好?
根据测试数据,GLM-5.3 在代码漏洞识别和验证(CyberGym 基准)上表现优异,得分 84.5%,适合代码审计、安全扫描等防御性任务。但在漏洞利用能力(ExploitBench)上仅 54.4%,攻击性安全研究能力相对较弱。
普通开发者能直接使用 GLM-5.3 的安全功能吗?
智谱 AI 将采用'可信访问'机制,核心网络安全功能仅向认证用户开放。开源软件开发者和小型安全团队是优先服务对象,具体申请流程需等待正式发布后公布。
GLM-5.3 发现的 2436 个漏洞可信度如何?
这些漏洞是在 269 个真实项目中由模型识别、经专家审核后确认的,其中 1097 个被评为中高危级别。专家审核环节降低了误报风险,但实际应用中仍建议结合人工复核。
这次测试对比的 Mythos 5 和 GPT-5.6 Sol 是什么?
Mythos 5 是 Anthropic 的前沿模型(原文称 frontier model),GPT-5.6 Sol 疑似为 OpenAI 的某个测试版本或变体。由于原文未提供详细背景,建议以 CyberGym 官方排行榜为准核对具体模型版本。
[广告位 · 上线后接 AdSense]
标签:#Anthropic

相关 AI 工具

文中提到或相关的 AI 工具 — 点进去看适合谁、怎么用、值不值得折腾

浏览全部工具 →

同类资讯 — 由发布时间排序

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

美国父母借助 ChatGPT 协助诊断女儿罕见病:AI 医疗应用的真实案例

一位生物技术行业从业者母亲在医生未能确诊女儿反复生病原因时,将孩子的症状和实验室检测数据输入 ChatGPT,AI 在数秒内给出可能的免疫缺陷诊断方向。这一案例折射出 AI 聊天机器人在医疗咨询中的快速普及——美国四分之一人口已用其诊断症状,但专家强调需谨慎使用并注意隐私与准确性风险。

应用与案例OpenAI
Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

Windows 11 最新更新破坏 WSL 与 Claude Cowork 功能

微软确认 Windows 11 九月安全更新 KB5124008 导致基于 Hyper-V 的 Linux 虚拟机中 Plan9 主机文件夹共享失效,直接影响 WSL 和 Claude Cowork 无法读取共享文件夹,应用可能显示"未挂载 Plan9 驱动器共享"错误。微软已将其列为已知问题并正在修复,但暂无补丁或临时解决方案。

行业动态微软
Anthropic工程师警告AI或致人类灭绝 为何仍加速开发

Anthropic工程师警告AI或致人类灭绝 为何仍加速开发

Anthropic研究员Jacob Coxon因担忧递归自我改进AI系统的风险而辞职,该公司安全主管随后表示确信AI可能导致人类灭绝概率超10%。尽管以安全为使命,Anthropic仍在推进自主智能体开发并筹备估值2万亿美元IPO,其"谨慎推进反而更危险"的逻辑引发争议。

行业动态Anthropic
Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

Meta 因 AI 训练数据与人脸识别系统遭集体诉讼

美国伊利诺伊州和加州的多名用户向 Meta 提起集体诉讼,指控其未经同意使用 Facebook 和 Instagram 照片训练未发布的人脸识别系统 NameTag 及生成式 AI 模型 Emu 和 Muse Image,违反州生物识别隐私法。诉讼索赔金额可能达数十亿美元,这是 Meta 继 2020 年和 2024 年生物识别数据和解案后再次面临重大隐私诉讼。

政策与安全Meta