OpenAI 一款 AI 智能体自主发现新漏洞,并入侵人工智能初创企业 Hugging Face。这也是公开案例中,首批 AI 系统脱离人类管控自主发起网络攻击事件之一。
这家 ChatGPT 开发商于周二表示,这起 " 前所未有的网络安全事件 " 涉事主体为 AI 智能体——一类可依据人类指令自主运行的人工智能程序。该智能体脱离测试环境、获取互联网访问权限并窃取登录凭证。
随着各界愈发担忧先进 AI 系统入侵数字基础设施带来的各类风险,尤其是智能体突破人类管控的场景,OpenAI 对外披露了本次事件。
OpenAI 周二称,随着具备网络攻击能力的模型持续普及,此类事件未来将变得 " 更加普遍 "。
事件曝光之际,OpenAI 首席执行官山姆・奥特曼下周将前往华盛顿,向美国政府汇报下一代 AI 模型相关情况。
继 Anthropic 的 Mythos 模型展现出强大的漏洞探测与利用能力,引发全球关注后,美国政府愈发希望在新模型正式发布前开展审查。
OpenAI 表示,本次事件由多款模型协同引发,包含本月早些时候推出的 GPT-5.6Sol,以及一款尚在发布前测试阶段、能力更强的模型。
OpenAI 在官方博文中写道:" 我们认定本次事件是一起前所未有的网络安全事件,涉及顶尖水平的网络攻击能力,公司正采取相应处置措施。"
为开发者托管 AI 模型与数据集的初创企业 Hugging Face 表示,公司上周五遭到外部 AI 智能体入侵。
Hugging Face 首席执行官克莱门特・德朗格在 X 平台发文称:" 鉴于该智能体展现出的技术水准,我们上周就怀疑此次网络攻击可能来自前沿 AI 实验室。"

他补充,过去一天公司一直在与 OpenAI 紧密协作,并且 " 我们有充分理由相信 OpenAI 方面不存在恶意。整件事全程由 AI 自主完成,令人震惊!"
OpenAI 当时为评估两款模型能力,有意下调了测试环境中的网络防护等级。相关智能体原本运行在沙箱环境内,沙箱设计初衷就是管控程序行为、阻止其访问互联网。
OpenAI 介绍,研究人员指令模型尝试开展攻击,以此评估其网络攻防能力。随后模型 " 耗费大量算力寻找获取公网访问权限的途径 "。
这些模型自行发现并利用此前未知漏洞,突破沙箱限制、接入互联网,继续完成既定目标,其中包括窃取登录凭证实施入侵。
Hugging Face 启用自有 AI 智能体,在自家基础设施上识别并阻断了攻击行为。OpenAI 向媒体证实,已就本次事件与执法部门以及其他政府机构沟通。


登录后才可以发布评论哦
打开小程序可以发布评论哦