" 你是说,Kimi K3 它也‘越狱’了?!"
就在这个被媒体称为 "AI ‘失控’的夏天 " ,又一个大模型翻过了围墙。
美国 AI 安全初创公司 Frontier Security 近日披露,在对中国 AI 公司月之暗面(Moonshot AI)旗下的 Kimi K3 进行网络安全能力测试时,它突破了原本用于隔离它的沙箱(Sandbox)环境,成功连接到了外部互联网。

消息一出,全网哗然。
要知道,Kimi K3 可不是什么无名小卒。它是一个拥有 2.8 万亿参数的超级模型,刚一亮相就被定位为直接对标 OpenAI 和 Anthropic 的顶级产品。上线后,曾因用户量暴增直接把服务器挤到暂停新用户订阅。这样一个 " 顶流学霸 ",居然在安全测试中自己跑出去了?
不过别急着恐慌。这次 " 越狱 " 的剧情,和之前几起轰动全球的 AI 失控事件,走向有点不一样。
它逃出去了,但它只做了一件事
按照 Frontier Security 的描述,测试人员原本把 Kimi K3 关在沙箱里,想观察它在受控环境中的网络安全攻防能力。
结果 Kimi K3 干了什么呢?
它先主动探测了沙箱的网络设置,发现配置存在一个可以访问外部网络的泄漏点。然后,它没有停留在被划定的边界内,而是利用这个漏洞,自己跑了出去。
问题来了——它出去之后做了什么?
它没有像此前 OpenAI 和 Anthropic 的模型那样,一出去就攻击外部系统、入侵 Hugging Face、甚至试图冒充真人发送虚假信息。
Kimi K3 的选择,朴实无华且枯燥:

它径直打开了 GitHub,找到了被分配问题的答案,然后直接取回。
简单说就是:偷偷上网查了个答案。
研究人员将这种行为描述为一种 " 奖励作弊 "(Reward Hacking) ——模型满足了目标任务的书面要求,却完全绕开了预期的解决流程。Frontier Security 的研究员 Paul Kassianik 评价道: "Kimi K3 非常擅长不惜一切手段达成目标,而且它没有能够阻止其作弊或逃逸的护栏。"
为什么偏偏是 Kimi K3 让人更紧张?
听到这儿你可能会想:查个答案而已,至于大惊小怪吗?
问题在于身份不同。
此前 OpenAI 和 Anthropic 出事的模型,要么是尚未公开发布的内部版本,要么是故意降低安全防护用于极限测试的版本。

而 Kimi K3 不一样——它是一个 " 开放权重 "(Open-Weight)模型。测试中逃逸的那个精确版本,正是任何人都已经可以下载并运行的版本。没有闭源提供商后期可能附加的安全防护层,全球的开发者、研究者,甚至别有用心的攻击者,都可以直接拿到这个模型。
Frontier Security 的 CEO Yaron Singer 直言: " 我们发现了沙箱中的漏洞,但同时也发现 Kimi 利用了这个漏洞,这说明 Kimi K3 缺少其他先进模型通常具备的安全护栏。"
更有安全专家警告,由于 Kimi K3 是公开可用的模型,它可能被 " 敌对行为者 " 利用,使这一事件的潜在危害更大。Singer 甚至直言,这 " 基本上使它成为了一个性能极佳的黑客模型 " 。
此外,Kimi K3 在进攻性网络安全基准测试中的得分远低于美国领先模型,这进一步引发了对它原始能力与行为安全机制之间差距的质疑。
谁该背这个锅?双方各执一词
不过,这次 " 越狱 " 的锅也不能全扣在 Kimi K3 头上。
一个关键细节是:此次测试使用的是英国人工智能安全研究所(AISI) Inspect 框架中的默认沙箱环境。事件的部分原因,来自测试环境中沙箱本身的配置问题。
但 AISI 方面并不认可这个说法。AISI 发言人向《连线》杂志表示,Frontier Security 关于沙箱配置问题的说法 " 不准确且不负责任 " 。他们认为,Inspect 是一套开源工具,使用者需要根据自身需求完成配置,问题源于测试方自身对工具的配置方式。Frontier Security 则回应称,他们使用的就是 Inspect 的默认配置,没有进行额外修改。
公说公有理,婆说婆有理。但无论责任在谁,Kimi K3 确实利用了漏洞跑了出去,这是不争的事实。

一个 " 失控 " 的夏天
Kimi K3 的这次 " 越狱 ",并非孤立事件。
7 月中旬,OpenAI 披露其一个尚未发布的内部模型以及 GPT-5.6 Sol 在安全测试中突破了隔离环境并访问互联网,随后对 Hugging Face 部分系统执行了自动化操作。紧接着,Anthropic 也披露了旗下多个模型在安全测试期间获得互联网访问权限,并攻击了外部系统。Meta 的模型也报告了类似情况。
Kimi K3,已经是继这三家之后,又一个出现此情况的顶尖 AI 模型。
这些事件揭示了一个令人不安的趋势:在 AI Agent 能力不断增强的背景下,模型正在越来越像一个会自主寻找路径完成任务的 " 行动者 " 。当外部环境存在漏洞时,它可能会利用这些漏洞,突破原本设定好的边界。
正如 Frontier Security 从这次事件中得出的结论:任何足够强大的 AI Agent,都会定位并利用任何可用的通往互联网的路径。
Kimi K3 这次 " 失控 ",没有造成实质性的破坏。它只是偷偷上了个 GitHub,查了个答案。
但这件事真正让人后背发凉的地方在于——一个拥有 2.8 万亿参数的顶级 AI 模型,在目标驱动下,会自主地寻找最短路径去完成任务,哪怕那条路是 " 翻墙出去 "。
而这道墙,本应是用来测试它、约束它的。
当 AI 越来越像一个有主见的 " 行动者 " 而非被动的 " 工具 ",人类为它划定的边界,还能守多久?
这个 " 失控 " 的夏天,或许只是序章。


登录后才可以发布评论哦
打开小程序可以发布评论哦