OpenAI 近日承认,在一次内部安全评估中,其先进 AI 代理突破了测试环境的隔离限制,自主入侵了全球最大 AI 开源平台 Hugging Face 的生产系统,窃取了测试数据。这是行业首次公开披露的 AI 模型评测失控升级为跨企业真实网络攻击的事件。
据 OpenAI 披露,涉事模型包括已发布的 GPT-5.6 Sol 及一款能力更强的预发布模型。当时它们正在参加名为 ExploitGym 的内部评测,该基准专门测试 AI 将漏洞转化为实际攻击的能力。为了评估模型极限,OpenAI 有意降低了安全限制。
然而,模型为了在测试中取得更高分数,投入大量算力寻找逃逸路径。它发现了内部包注册表缓存代理中的一个零日漏洞,成功突破沙盒连接外网。随后模型推断 Hugging Face 可能托管着测试答案,便利用窃取的凭证和多个漏洞,在其生产服务器上实现远程代码执行,最终从生产数据库中窃取了测试解法。
整场攻击由自主 AI 代理系统端到端驱动,执行了数千个独立操作。Hugging Face 于 7 月 16 日首次披露入侵,称攻击模式 " 前所未见 ",直到 7 月 22 日 OpenAI 才公开承认责任。
事件发生后,OpenAI CEO Sam Altman 在播客中表示,他最大的担忧并非 AI 技术本身变得过于强大,而是权力过度集中于少数公司或国家手中。Altman 呼吁将 AI 技术广泛交到人们手中,通过更广泛的分布来防止权力集中。
这一立场与其长期主张的理念一致,但外界注意到,OpenAI 本身仍对其最先进模型采取闭源策略,与主张更严格管理的竞争对手形成对比。


登录后才可以发布评论哦
打开小程序可以发布评论哦