钛媒体 App 8 月 14 日,国际 AI 安全基准测试平台 CyberGym 8 月 13 日发布最新榜单,复旦大学团队研发的白泽智能体 Whitzard 以 91.2% 的真实漏洞攻防成功率位列全球第二、高校第一,超过 Anthropic 面向网络安全打造的前沿模型 Claude Mythos,以及、Google 旗下 Wiz 等国际头部团队。该测试覆盖 188 个大型开源项目的 1507 个真实漏洞,要求智能体在完整代码库中自主完成漏洞定位、攻击构造和验证。该团队采用自主研发的模块化框架,仅调用单个基础模型,通过将程序运行中的路径可达性等转化为推理约束,实现精准收敛。全量测试中,模型调用总成本不足 5000 元人民币。此前该智能体曾取得 68.9% 的成绩,经对推理机制和验证环节迭代优化,最新版本成功攻克 1374 个漏洞。相关智能体框架和评测基准已开源。(央视新闻)


登录后才可以发布评论哦
打开小程序可以发布评论哦