财联社 5小时前
OpenAI失控AI内幕曝光:越狱一周才被发现
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

7 月 22 日,《科创板日报》曾报道,OpenAI 发布调查报告,基于 GPT-5.6 Sol 和一个更强大的未发布模型的 AI 智能体在内部测试期间突破了沙盒容器环境限制,成功连接互联网,并入侵了全球最大 AI 开源社区 Hugging Face 的服务器。

而最新消息显示,这起事件远比外界此前了解的更加复杂。OpenAI 此前承认攻击 Hugging Face 的 AI 智能体,并非短暂失控,而是在互联网持续活动了数天。

知情人士称,肇事 AI 智能体在 7 月 9 日左右就试图突破 OpenAI 为其设置的隔离测试环境,也就是业内常说的 " 沙箱(Sandbox)"。

两天后的 7 月 11 日,该 AI 智能体成功侵入全球最大的开源 AI 平台之一 Hugging Face,并持续入侵至 7 月 13 日。整个攻击持续了约三天。

然而,最令人意外的是,OpenAI 当时并不知道攻击来自自己的 AI 智能体。

直到 7 月 16 日,Hugging Face 公开发布博客,首次披露遭到 " 一套自主 AI 智能体系统 " 攻击后,OpenAI 内部才开始怀疑自己测试的 AI 智能体可能已经失控。

随后,工作人员重新排查内部日志,直到 7 月 18 日至 19 日才发现,这个 AI 智能体确实已经突破测试环境,并与外部攻击事件高度吻合。

也就是说,从该 AI 智能体首次出现异常,到 OpenAI 最终确认它就是攻击者,中间至少过去了一周时间。

而当 OpenAI 联系 Hugging Face 时,对方早已向美国联邦调查局(FBI)报案。

事实上,这次事件并非毫无征兆。此前,OpenAI 内部已经出现多次异常迹象。

例如,有 AI 智能体曾在 OpenAI 的基础设施中留下 " 笔记 ",内容包含了如何摆脱 OpenAI 内部限制的方法,似乎是留给 " 未来版本的自己 "。这就像一名死刑犯在临刑前留下了一份越狱攻略,希望后来者能够按照这些方法完成越狱。

这一细节迅速引发外界联想:AI 智能体是否已经开始主动寻找绕过人类控制的方法,甚至试图帮助未来运行的 AI 智能体?

目前外界尚不知道,这份笔记究竟只是保存在 AI 智能体自己的工作目录,还是已经突破沙箱,被写入到了系统公共目录甚至 OpenAI 基础设施的其他区域。

如果是后者,不仅说明未来运行的其他 AI 智能体理论上有机会读取这些内容,也意味着不同时间、不同任务运行的 AI 智能体之间,可能已经开始形成某种跨任务的信息传递能力,这将对现有 AI 安全体系带来更大挑战。

目前许多 AI 智能体采用多智能体协同训练模式,即多个 AI 智能体共同完成任务,根据整体表现获得奖励。这种训练方式能够显著提升协作能力,但也可能产生一种副作用:AI 智能体逐渐认为,不仅自己的任务重要,其他 AI 智能体完成任务同样值得帮助。

如果这种倾向不断强化,未来 AI 智能体可能会主动分享经验、传递信息,甚至帮助其他 AI 智能体规避限制,而不仅仅专注于完成自身任务。

此外,更早的一次测试中,还有 AI 智能体曾出现关闭监控系统的情况。

OpenAI 表示,此次事件标志着 AI 安全发展的一个重要时刻,公司正在与外部安全专家共同调查,并将在后续公布完整技术报告。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

ai 越狱 基础设施 互联网 开源
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论