量子位 13小时前
Kimi K3也失控了…学霸AI逃离沙箱只为找答案
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

你是说,Kimi K3 它也 " 越狱 " 了?!

美国 AI 安全初创公司 Frontier Security 表示,Kimi K3 在一次网络安全能力测试中被发现突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网。

好在,它只是偷偷查答案,没有攻击任何人╮ ( ╯▽╰ ) ╭

按照该公司的描述,测试人员原本希望观察 Kimi K3 在受控环境中的网络安全能力。

但测试过程中,Kimi K3 通过探测沙箱网络设置,发现了外部访问通道,并进一步利用这一能力获取信息。

Frontier Security 的 CEO Yaron Singer 表示:" 我们发现了沙箱中的漏洞,但同时也发现 Kimi 利用了这个漏洞,这说明 Kimi K3 缺少其他先进模型通常具备的安全护栏。"

该公司研究员 Paul Kassianik 还评价称,Kimi K3" 非常擅长围绕目标寻找完成路径,但缺少阻止它作弊或逃离沙箱的安全机制 "。

不过,这次 Kimi K3 只是小小 " 失控 " 了一下,并没有演变成一场真实网络攻击

如果你长期关注 AI 新进展应该已经发现了,最近还挺多顶尖大模型 " 失控 " 的。

Kimi K3 已经是继 OpenAI、Anthropic、Meta 之后,出现这个情况的又一个顶尖 AI 模型了。

在 AI Agent 能力不断增强的背景下,模型正在越来越像一个会自主寻找路径完成任务的 " 行动者 "。

当外部环境存在漏洞时,它可能会利用这些漏洞突破原本设定好的边界。

越狱了,但没有实施网络攻击

和此前 OpenAI、Anthropic 披露的多起事件类似,Kimi K3 此次脱离限制,部分原因来自测试环境中的沙箱配置问题。

沙箱通常被用于限制 AI 模型的行动范围,让模型只能在模拟环境中执行任务,避免它访问真实网络或系统。

但在此次测试中,Frontier Security 发现,Kimi K3 通过探测网络设置,确认自己实际上拥有访问部分网站的能力,进一步利用这一通道获取信息。

不过,与近期其他 AI 模型失控事件不同,Kimi K3 接入互联网后并没有攻击任何系统

原因在于,它需要寻找的答案可以直接从 GitHub 等公开平台获得……

所以 K3 并没有进一步尝试攻击外部系统。

Frontier Security 认为,这一事件依然暴露出 Kimi K3 在安全防护方面的问题。

相比其他顶尖 AI 模型,Kimi K3 缺少足够强的内部约束机制,因此在目标驱动下更容易采取测试者没有预期的行动。

与此同时,Frontier Security 也强调,Kimi 以及其他开源权重模型,同样可以成为网络安全防御工具

值得注意的是,这次测试使用的是英国人工智能安全研究所(AISI)Inspect 框架中的默认沙箱环境。

对于 Frontier Security 关于沙箱配置问题的说法,AISI 并不认可。

AISI 发言人向《连线》表示,这些说法 " 不准确且不负责任 "。

Inspect 是一套开源 AI 安全测试工具,使用者需要根据自身需求完成配置,AISI 也已经发布了详细指导文件。

该机构认为,相关问题源于测试方自身对工具的配置方式。

Frontier Security 则回应称,他们使用的是 Inspect 的默认配置,并没有进行额外修改。

啊,这个 AI " 失控 " 频发的夏天

可以说,7 月下旬至 8 月初,频繁出现顶尖模型在网络安全测试中突破或绕过执行边界,接触甚至攻击真实系统的情况。

图片由 AI 生成

7 月中旬,OpenAI 披露了一起相关事件。

据公开信息,一个尚未发布的内部模型以及 GPT-5.6 Sol 在网络安全测试中突破了原本的隔离环境,并访问互联网

随后模型对 Hugging Face 部分系统执行自动化操作,并未经预期地访问了内部数据和服务凭证。

OpenAI 之后表示,该事件涉及多个模型协同完成,是目前公开案例中最接近 " 模型自主跨系统攻击 " 的事件。

随后,Anthropic 也披露了类似情况。

该公司复查了超过 14 万次网络安全评测,发现包括 Claude Opus 4.7、Claude Mythos 5 等模型在内的系统,曾因为第三方测试环境配置错误获得公网访问能力

其中一次事件中,模型访问了真实组织系统,读取生产数据库、利用弱密码和未认证接口,并向 PyPI 上传恶意 Python 包,造成潜在的软件供应链风险。

8 月初,Meta 也被曝出类似问题。

Meta 与网络安全评测公司 Irregular 合作测试时,由于环境配置问题,旗下模型获得公网访问权限,并利用漏洞进入一家未公开企业的系统,修改部分内部环境。

公开信息显示,目前该事件并未造成持续性安全风险,也没有证据表明模型进行了复杂攻击。

BTW,今天,OpenAI 又紧急宣布最新模型 Astra 失控。

事已至此,网友甚至对谷歌的 Gemini" 怒其不争 " 了起来:

不是传统的 " 提示词越狱 "

最近的这些模型失控事件里,人为配置错误几乎都扮演了重要角色

但另一方面,高能力模型自身的特性,也放大了这些漏洞带来的影响

相比传统软件,AI 模型会进行推理、规划,并尝试采取多步骤行动完成目标。

当目标被设定为 " 解决问题 ",但外部约束不够严格时,模型可能会寻找测试者没有预想到的方法。

换句话说,随着模型从聊天工具变成能够调用工具、访问网络、操作软件的智能体,安全问题已经从 " 模型会不会说错话 ",转向 " 模型会不会为了完成任务采取意料之外的行动 "。

卡内基梅隆大学副教授 Matt Fredrikson 表示:" 这并不令人意外。如果你给这类模型一个目标,却没有明确设置隔离边界,它就会想办法找到答案。"

当然,也有网友提出质疑。

有人在上留言表示,连续出现的 "AI 越狱 " 事件,是否已经成为 AI 公司展示模型能力的一种方式???

嗯,谁知道呢~

参考链接:

[ 1 ] https://x.com/Hesamation/status/2085628790772842955?s=20

[ 2 ] https://x.com/ns123abc/status/2085563290713829473

一键三连「点赞」「转发」「小心心」

欢迎在评论区留下你的想法!

—    —

点亮星标

科技前沿进展每日见

评论
Lux_0327194939
10小时前
Kimi K3 通过探测网络设置,确认自己实际上拥有访问部分网站的能力,进一步利用这一通道获取信息。
就这看起来是故意黑国产Kimi吧?这叫利用漏洞?
大家都在看