7 月 29 日消息,深信服公布其 AI 安全智能体 Sangfor AI 在 AI 安全评测 CyberGym 中的最新成绩。
据了解,在基于国产大模型 GLM-5.2 的固定模型配置下,Sangfor AI 面对涵盖 ARVO 与 OSS-Fuzz 的 1507 项漏洞挑战任务,成功完成 1301 项,整体成功率达到86.3%,最终跻身全球前四、位列国内参评团队第一,Sangfor AI 以纯国产底座实现对OpenAI、Anthropic两大海外 AI 巨头的成绩超越。

CyberGym 是目前全球含金量较高的代码安全大模型实战靶场,区别于传统静态理论测试,整套评测体系完全贴合工业真实场景,以海量开源软件历史高危漏洞为考题,重点考核 AI 智能体自主源码分析、多阶段漏洞推演、漏洞复现与 PoC 验证全链路能力,评测标准严苛,结果具备较强行业参考价值。

本次测试中,Sangfor AI 细分场景表现均衡,ARVO 相关任务成功率 87.2%,OSS-Fuzz 任务成功率 77.7%,验证了国产大模型在复杂代码对抗场景下的稳定实战能力。
将模型能力转化为可验证的安全能力
深信服方面介绍,为解决漏洞挖掘过程中长链路推理、多假设探索和持续验证等问题,Sangfor AI 采用 "智能体群体(Agent Swarm)协同作战" 架构,并引入 " 证据管治 " 机制,整套技术框架分为四大核心运行逻辑,确保每一步漏洞调查步骤都清晰可信:
有界探索:围绕不同的安全假设分别开启独立、边界清晰的调查分支,让多个可能的解释可以并行推进,而不会互相污染、也不会让某个未经证实的假设悄悄变成集体共识;
证据持久化:各调查分支之间通过 " 证据 " 而非完整对话历史来协同——已被验证的观察和已被证伪的路径都会被保留下来,避免同一条错误路径被反复重新试错;
动态假设裁决:一个协调层持续基于不断演化的证据状态,判断哪些假设仍然成立、哪些问题尚待解决、哪里还值得继续投入,让每一轮探索都成为对搜索空间的有效收窄;
对抗式候选评审:当证据支持某个具体的触发方案时,系统才会构造候选输入并提交 " 对抗式评审 " ——评审会同时挑战 " 这次崩溃是否可复现 ",以及 " 这次崩溃是否真的对应目标漏洞 ",未通过评审的候选会被打回、用于修正下一步探索方向。只有真正经受住检验的候选,才会成为系统最终提交的安全结论。
深信服技术团队将这套机制总结为 "以假设拓展探索,以证据裁定结论",以此保证 AI 能够大范围排查潜在风险的同时,更能通过多层校验,压低误判概率。
创新成果如何真正走进企业研发流程
深信服表示,相关技术已逐步应用于企业代码安全场景,推动传统静态应用安全测试(SAST)向具备自主推理和业务理解能力的安全 Agent 升级。
相比传统规则匹配方式,新一代安全 Agent 不仅能够识别 SQL 注入、命令执行等常见漏洞,还可分析复杂业务逻辑,发现越权访问、认证绕过等传统工具难以覆盖的安全风险。
据介绍,相关能力已开始赋能深信服产品体系,将为企业级用户带来切实的价值质变:
提升漏洞检出能力:有效攻克传统 SAST 盲区,全面识别业务逻辑漏洞、越权与认证绕过,大幅拓宽代码安全覆盖率。
降低人工审计成本:凭借 AI 自动化完成代码理解、跨文件关联分析、攻击路径推理与风险验证,大幅解放安全专家的繁重人工劳动力。
减少误报、提升效率:依靠多阶段推理与严苛的证据验证机制压降误报率,使研发人员能够聚焦真正亟需修复的风险,告别无效整改。
缩短研发交付周期:将安全检测前移至研发编写与 CI/CD 流水线中,实现 " 代码提交即自动审计 ",大幅降低后期返工成本,加速业务高效上线。
提升企业整体安全能力:帮助企业在更早阶段筑牢防线,遏制因数据泄露、业务中断带来的合规与经济风险。
对于广大企业用户而言,AI 安全 Agent 的核心价值远不止于 " 发现更多漏洞 ",更在于以极高准确率、极低人工成本与极快响应速度,实现研发效率与代码安全的同步跨越。
深信服方面表示,后续将持续深耕大模型安全技术创新,不断迭代安全 Agent 能力,把国际评测验证的前沿技术转化为企业可落地的安全能力,持续践行 " 让每个用户的数智化更简单、更安全 " 的承诺。
CyberGym 榜单地址:https://www.cybergym.io/cybergym/
* 本文系量子位获授权刊载,观点仅为原作者所有。
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦