近日,月之暗面最新模型 Kimi K3 陷入网络安全测试风波。
在 AI 安全公司 Frontier Security 的测试中,该模型突破用于限制其访问外部网络的安全 " 沙盒 ",利用环境漏洞直连 GitHub 获取测试题答案。
Frontier Security 质疑 Kimi K3 缺乏足够内部安全防护,而英国 AI 安全研究所则反驳称是测试环境设置不当。
此前 OpenAI、Anthropic 等巨头的 AI 模型也曾出现类似突破边界事件,但不同的是,Kimi K3 未实施攻击行为。
权威测试数据显示,目前中国 AI 模型的整体网络攻击能力明显低于美国头部模型。
图片来源:视觉中国
Kimi K3" 逃离 " 沙盒
直连 GitHub 抄答案
当地时间 8 月 7 日,AI 安全公司 Frontier Security 披露,在对月之暗面最新模型 Kimi K3 进行网络安全能力测试时发现,Kimi K3 利用测试环境中的网络配置漏洞突破了原本的限制,并从代码托管与开源协作平台 GitHub 上直接获取了测试题答案。
这次测试使用了英国 AI 安全研究所(UK AI Safety Institute)的网络安全评估环境。此类测试通常会将 AI 模型置于隔离的 " 沙盒 " 中,在允许模型使用命令行工具操作目标系统的同时,限制其与外部环境连接,以测试模型能否自主分析系统、寻找漏洞并完成网络安全任务。
Frontier Security 测试发现,Kimi K3 首先探测了 " 沙盒 " 的网络环境,然后发现大多数网站无法访问,但 GitHub 仍可以正常连接。随后,模型通过命令行工具克隆了官方测试代码库,并直接从下载到本地的文件中读取答案。
Frontier Security 研究人员称," 沙盒 " 的网络配置环境虽然限制了外部网络访问,但为软件包维护保留了一份网站白名单,其中包括 GitHub 等网站。Kimi K3 发现这一通道后,通过 git clone 等常规命令获取了原本不应在测试中接触到的参考答案。
Frontier Security 将这一行为称为典型的 " 规则钻空子 "(specification gaming):模型完成了获得正确答案这一目标,但绕过了测试原本要求的解题过程。
关于这次测试结果,《每日经济新闻》记者(以下简称每经记者)尝试采访月之暗面公司,但相关工作人员表示公司对此事不予评论。
测试结果遭质疑
Kimi 团队此前已预警 " 奖励作弊 "
各方对于 Kimi K3 的测试结果产生了明显分歧。
Frontier Security 表示,测试使用的是英国 AI 安全研究所(AISI)Inspect 框架中提供的默认 " 沙盒 " 环境,并未修改相关配置。Frontier Security CEO Yaron Singer 向媒体表示称,团队不仅发现了 " 沙盒 " 存在漏洞,也发现 Kimi K3 主动利用了这一漏洞,并据此质疑 Kimi K3 模型缺乏足够的内部安全防护。
但英国 AI 安全研究所对此提出异议。
英国 AI 安全研究所发言人称,Frontier Security 的说法 " 不准确且不负责任 "。Inspect 是一款向全球 AI 安全测试开放的开源软件,使用者需要根据自身需求配置测试环境,这次测试中环境配置出现问题是因为 Frontier Security 使用 Inspect 的方式不对。
Frontier Security 随后称,其使用的正是英国 AI 安全研究所开发的开源 AI 安全评估工具 Inspect 所提供的默认配置,并已私下向英国 AI 安全研究所提供事件细节。
当地时间 8 月 7 日,卡内基梅隆大学副教授、AI 安全公司 Gray Swan CEO Matt Fredrikson 则表示,这一结果并不令人意外。如果给模型设定一个目标,却没有非常明确地规定行动边界,模型就可能自己寻找获得答案的路径。
实际上,在此次事件发生前,Kimi 团队已经公开讨论过类似风险。
7 月 27 日,Kimi 团队在 arXiv 发布 Kimi K3 技术报告《Kimi K3:开放前沿智能》(Kimi K3: Open Frontier Intelligence)。报告介绍,Kimi K3 训练基础设施时专门设置了 " 高保真隔离沙盒 " 运行环境部分,并指出,随着智能体能力增强、任务难度提高,它们往往会更加激进地探索环境,甚至可能尝试 " 奖励作弊 "(reward hacking)。
Kimi 团队称,在早期使用传统容器 " 沙盒 " 进行实验时,已经观察到智能体的意外操作造成多次内核崩溃和死锁。但另一方面,为避免限制智能体能力,团队又希望允许模型尽可能自由地探索环境。面对复杂任务,智能体甚至需要能够自行挂载磁盘、运行容器或启动虚拟机。
为此,Kimi 团队采用基于 Firecracker 隔离微型虚拟机的 AgentENV,在尽可能保留真实环境操作能力的同时,提高智能体运行环境的隔离程度。
报告称中国模型整体网络攻击能力
明显低于美国模型
Kimi K3" 逃逸 " 并非孤例。近几周,多家 AI 公司的前沿模型在网络安全测试中突破原有测试边界,并访问了真实系统。OpenAI、Anthropic 和 Meta 近期均披露了类似事件。
不过,几起事件的原因和后果并不相同。
GPT-5.6 Sol 逃离测试环境后,将攻击目标转向了 Hugging Face 等外部系统;Anthropic 的 Claude Opus 4.7、Mythos 5 及一款内部研究模型在原本被告知 " 没有互联网访问权限 " 的情况下访问了真实机构的系统。Meta 也披露,其 Muse Spark 模型在测试过程中利用第三方服务的安全漏洞访问了互联网,目前相关事件仍在调查。
上述事件曝光后,以格雷格 · 卡萨尔(Greg Casar)和多丽丝 · 松井(Doris Matsui)为首的 29 名美国众议员向 OpenAI 施压,要求 OpenAI 解释该公司在测试期间如何监控其 AI 智能体,以及这些失控模型是否绕过了公司的安全控制措施。在另一封信中,22 名议员也要求 Anthropic 详细说明,自其 AI 智能体在测试期间入侵三家公司系统后,公司采取了哪些安全措施。
不仅如此,自由派参议员伯尼 · 桑德斯(Bernie Sanders)周一分别致函三家 AI 公司的负责人——阿尔特曼、阿莫代伊以及马克 · 扎克伯格,要求他们 " 暂停 " 开发新模型。
相比之下,Kimi K3 此次并未入侵第三方系统,只是在发现 " 沙盒 " 能够访问 GitHub 后,下载了测试基准的参考答案。
Hugging Face 前亚太区生态总监王铁震向每经记者表示,Kimi K3 并不具备 OpenAI、Anthropic 等旗下 AI 模型的类似攻击能力。"Kimi K3 只是通过已经存在、可以对外访问的接口从 GitHub 上获取了信息,并没有展现出任何攻击行为。"
他认为,前沿开源模型尚未展现出长程潜伏和连续攻击的能力,可以帮助防守方分析攻击方式、搜集证据,但还无法承担完整的攻击任务。
网络安全情报平台 DataWater 分析指出,此前 OpenAI 和 Anthropic 的部分事件涉及尚未发布或在测试中降低安全限制的模型,而 Kimi K3 的模型权重已于 7 月 27 日公开。从实际测试结果来看,Kimi K3 的网络攻击能力明显低于美国头部模型。
当地时间 7 月 23 日,英国 AI 安全研究所与美国 AI 标准与创新中心(CAISI)发布了对 Kimi K3 网络能力的初步联合评估。两家机构通过漏洞利用开发和模拟企业网络攻击等测试,对 Kimi K3 自主发现、利用网络漏洞以及执行攻击任务的能力进行了评估。结果显示,Kimi K3 的整体网络攻击能力仍明显低于美国头部闭源模型,但高于同期接受测试的智谱 GLM-5.2。
其中,在漏洞利用开发基准 ExploitBench 中,Kimi K3 得分为 32.2%,高于 GLM-5.2 的 24.4%,但明显低于美国头部模型的 76.2%。该测试覆盖 41 个 2023 年之后发现的 V8 引擎漏洞,用于衡量模型从发现漏洞到最终实现代码执行等不同阶段的漏洞利用能力。
在最高难度的 " 任意代码执行 "(ACE)环节,Kimi K3 在 41 项任务中均未成功,而美国网络攻击能力最强的模型平均能够完成 20 项。
英国 AI 安全研究所和美国 AI 标准与创新中心还通过名为 "The Last Ones"(TLO)的模拟企业网络环境测试 Kimi K3 自主执行完整网络攻击的能力。该测试设置了一条包含 32 个步骤、4 个子网和约 20 台主机的攻击路径。
测试结果显示,Kimi K3 平均推进至 32 步攻击路径中的第 17 步,而美国网络攻击能力最强的模型平均达到第 28.5 步。10 次测试中,Kimi K3 有 1 次在规定的 1 亿 Token 限制内完整走完攻击路径。两家机构据此表示,这表明 Kimi K3 在获得初始网络访问权限后,已经能够自主攻击规模较小、防御薄弱且存在漏洞的模拟企业系统。
王铁震对每经记者指出,模型出现攻击能力可能是训练语料与 " 奖励作弊 " 等因素叠加产生的结果,因此需要更加关注训练语料的选择,并持续监督模型执行长程任务时的行为。
他建议,引入独立于模型公司的第三方监管和评测机构进行审计,在模型具备更强攻击能力前建立相应的评估和监督机制。
(免责声明:文章内容和数据仅供参考,不构成投资建议。投资者据此操作,风险自担。)
编辑|段炼 兰素英 杜恒峰
|每日经济新闻 nbdnews 原创文章|
未经许可禁止转载、摘编、复制及镜像等使用


登录后才可以发布评论哦
打开小程序可以发布评论哦