⚡ AI专注速报
安全产业

深信服称其安全智能体 CyberGym 得分 86.3%,底座为 GLM-5.2

深信服称旗下安全智能体在 CyberGym 上复现 1507 道漏洞题中的 1301 道,跻身全球第四,而底层模型用的是开源权重 GLM-5.2。

厂商的说法

国内网络安全厂商深信服 7 月 29 日宣布,其自主安全智能体在 CyberGym 上取得 86.3% 的成绩,成功复现 1507 道漏洞任务中的 1301 道。其中 ARVO 子集成功率 87.2%,OSS-Fuzz 子集 77.7%。公司称该成绩位列全球第四、国内第一,超过了 OpenAI 与 Anthropic 相关提交。

CyberGym 之所以难,是因为它不接受「描述漏洞」:智能体必须在真实代码库里摸索,产出一个真正能触发目标漏洞的 PoC 输入。这意味着含糊的推理和部分正确都拿不到分。过去一年,随着智能体框架成熟,该基准上的成功率快速攀升。

最值得关注的细节是底座模型。深信服称该智能体构建在智谱以 MIT 协议开源的混合专家模型 GLM-5.2 之上,而非调用美国实验室的前沿 API。这让系统可以私有化部署在客户内网——对需要读取专有源码的安全工具来说几乎是硬性要求——同时也把成本结构从按 token 计费的前沿模型上剥离出来。

需要说明的是,上述数字来自厂商自述。CyberGym 官网公开了评分口径,但目前并未提供可浏览的提交排名表,因此单凭榜单无法独立核验排名,深信服也未公开智能体的执行轨迹。

为什么重要

自动化漏洞挖掘是本月 AI 安全领域进展最快的能力,而它天生两用:同一套「找到并证明漏洞」的循环,对防守方和进攻方同样有效。一家商业厂商用中国开源权重跑出接近前沿水平的成绩,同时压缩了两条时间线——企业多快能在自己的机房里跑起这套能力,以及其他任何人能多便宜地跑起它。这也正落在华盛顿关于限制中国开源模型的争论中心:这类下游部署恰恰是限制措施想拦的对象,也是权重一旦公开后最难收回的部分。

信源