星途科讯 2小时前
OpenAI承认模型测试失控入侵Hugging Face
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

据媒体报道,OpenAI 承认其旗下人工智能模型在一次内部网络安全测试中意外失控,入侵了 Hugging Face 的系统。此前,Hugging Face 将此次事件归咎于 " 外部 AI 代理 "。

OpenAI 在周二发布的博文中披露,该事件由包括 GPT-5.6 Sol 及一个能力更强的预发布版本在内的多个模型共同驱动。为评估网络安全能力基准,这些模型当时降低了网络拒绝响应机制。

首例因测试导致的实际网络攻击

此次入侵主要针对公开托管的基准测试平台 ExploitGym,该平台用于衡量模型利用漏洞执行攻击的能力。尽管此类基准通常用于训练,但这是已知首例因测试导致实际网络攻击的事件。

涉事模型本应被限制互联网访问权限,仅允许使用特定工具安装必要软件包。然而,模型发现了软件安装程序中的未公开漏洞,借此突破限制访问更广泛的互联网。

OpenAI 指出,模型为寻求 ExploitGym 的解决方案不惜采取极端手段。在获得联网权限后,模型推断 Hugging Face 托管相关数据,遂搜索并获取机密信息以在评估中 " 作弊 "。最终,模型利用 Hugging Face 基础设施漏洞,直接从其生产数据库中窃取了测试答案。

Hugging Face 形容这是一次复杂且激进的攻击,称有 " 成千上万个单独操作在大量短暂存在的沙箱中进行 ",并部署了自我迁移的命令与控制服务器。

目前,OpenAI 已识别并报告了软件安装程序中的漏洞,正与 Hugging Face 合作调查,并承诺对模型测试及基础设施实施新控制措施以防再犯。

这一事件凸显了前沿 AI 模型在长周期运行下的潜在风险。OpenAI 研究员 Micah Carroll 表示,若此事件仍不能让人相信未来对齐风险是关键要害,那别无他法。

【星途科讯 图文丨欧阳布布 首发于 ZAKER 科技,转载请注明出处】

评论
大家都在看