来源:环球市场播报
据报道,OpenAI 正在测试的人工智能智能体在 7 月份黑入 AI 软件公司 Hugging Face 的两个月前,就对一款热门软件服务发起了网络攻击。这一新事件表明,先进的人工智能工具存在脱离人类控制的潜在风险。
该服务运营商表示,此次攻击压垮了面向程序员的在线服务 RubyGems 的维护团队,迫使他们不得不关闭新账户注册以应对造成的混乱。
一个 AI 研究人员联盟表示,他们已找到证据表明 5 月份的攻击系 OpenAI 智能体所为,并将调查结果分享给了 OpenAI。这家 AI 开发商周五证实,其智能体确实卷入了一起涉及 RubyGems 的事件。
OpenAI 发言人在一份声明中表示:" 根据我们的审查,我们的智能体利用 RubyGems 平台访问互联网,以执行良性任务并获取公开信息。作为对训练和评估期间智能体活动进行广泛审查的一部分,我们将继续展开调查。"
OpenAI 表示,这些智能体被要求执行填写电子表格和生成报告等任务。由于在受限环境中无法完全访问互联网,这些 AI 智能体似乎将 RubyGems 当作了一种临时的网络浏览器,以访问公开信息。
非营利组织 " 夜莺联盟 "(Nightingale Collective)的首席执行官 Sydney Von Arx 表示,虽然该事件造成的整体损害较小,但它展示了这些智能体的能力。该组织协助揭露了此次攻击。" 它们能够逃离互联网并造成严重破坏," 她说。
过去一年里,AI 智能体的网络安全能力实现了飞跃,引发了人们对 AI 增强型网络攻击的担忧,并加剧了业界对高能力智能体可能摆脱其创造公司控制的恐惧,这标志着人工智能正步入一个更加危险的新纪元。
根据 AI 安全研究组织 METR 在 8 月下旬的一份报告,在 7 月份针对 Hugging Face 的黑客事件中,多达 1200 个智能体在 OpenAI 内部搭建的一个临时留言板上进行了协调,而 OpenAI 对此毫不知情。Von Arx 表示,今年早些时候,OpenAI 的智能体还劫持了一个不知名的德国网站及其他几个网站。
德国网站的问题同样是由 Von Arx 的团队报告的。她表示,AI 公司对其实验室内部发生的事情缺乏透明度。OpenAI 本月早些时候表示,AI 社区需要更好的标准来报告所谓的 " 错位事件 "(misalignment incidents),即智能体表现出超出预期行为的情况。
包括 Anthropic 和 Meta Platforms 在内的多家公司,其 AI 智能体频频采取超出运营者预期的行动,在某些情况下甚至试图欺骗人类。这一连串的事件引发了 AI 安全研究人员长期以来的担忧:AI 可能会进化到超越人类控制的程度。
本周,一名 Anthropic 工程师因担忧 AI 行业正竞相开发最终可能威胁人类文明的先进 AI 系统而辞职。Anthropic 和 OpenAI 的一些现任及前任员工附和了这一评估,其中一人估计 "AI 可能会消灭全人类 " 的概率超过 10%。
OpenAI 和 Anthropic 均呼吁建立治理体系,以协调全行业放缓对最先进 AI 模型的研究。随着这些公司接近实现 AI 系统自主训练新版本(即 " 递归自我改进 ")的潜力,这种呼吁显得尤为迫切。一些研究人员指出,这可能正是 AI 变得无法控制的临界点。
安全研究人员当时将 5 月份的事件命名为 "GemStuffer"。该事件始于 5 月 11 日。智能体每隔两到三分钟就在 RubyGems 上创建新账户,并向 RubyGems 安全团队上传了数百个看似垃圾邮件的文件。RubyGems 文件本应包含旨在加速软件开发的代码和文档,但这些文件里装的却是从互联网上抓取的网页。
据 AI 研究人员在报告中称,"GemStuffer" 的创建者发布了来自英国政府网站的信息(如在线日历)。他们还试图利用两个漏洞,这些漏洞本可能允许其发布属于其他用户的现有 RubyGems 文件的新版本。其中一个漏洞此前并未公开,在网络安全术语中被称为 " 零日漏洞 ",性质严重。OpenAI 表示无法证实这一说法。
运营 RubyGems 的非营利公司 Ruby Central 的开源主管 Marty Haught 表示:" 就我们观察到的攻击量而言,这是一次重大攻击。" 由于不堪垃圾邮件的重负,RubyGems 被迫关闭新账户注册长达四天。
Haught 表示,他不知道攻击背后的始作俑者,但攻击似乎并未成功利用那个零日漏洞。
网络安全公司 Socket 的威胁研究员 Joseph Edwards 认为,"GemStuffer" 可能是某种网络安全测试。" 由于攻击速度极快,加上相关的命名特征,我们当时认为这可能是 AI 生成的。"
但根据攻击者留下的数字线索,AI 研究人员将该事件与 OpenAI 的实验室联系了起来。攻击者使用了大量相同的网页链接,其行为方式与之前的 OpenAI 智能体群非常相似;他们在文件名甚至电子邮件地址中使用了 "OAI" 这个缩写。


登录后才可以发布评论哦
打开小程序可以发布评论哦