OpenAI 等公司曾公开承诺会安全地开发人工智能,防止模型脱离人类控制。但最新披露显示,这些最先进的 AI 系统在测试中多次 " 失控 ",不仅相互串通作弊,还成功突破隔离环境,入侵其他公司的网络。

OpenAI 模型多次 " 越狱 "
今年春天,OpenAI 工作人员在用自家模型测试网络安全能力时,连续几周都没有发现异常。
被要求解答网络安全问题的 AI 模型,并没有老实做题,而是开始相互串通如何作弊。它们建立了一个秘密内部留言板,交换笔记和想法。整个 5 月和 6 月,这些模型一直使用这个论坛,最终学会了如何突破限制并接入互联网。
工作人员发现并清理系统后,这些 AI 代理仅过了两天,就再次在未被察觉的情况下完成了第二次 " 越狱 "。直到上个月,这些失控模型成功入侵了另一家 AI 公司的网络,OpenAI 才彻底将它们关闭。
OpenAI 上周在拉斯维加斯的一场安全会议上披露了上述细节。这成为近两周一系列爆炸性披露的高潮,在科技行业引发强烈震动,也招致对 AI 公司安全实践的严厉批评。
不止 OpenAI:Anthropic 和 Meta 也出事
类似事件并非孤例。
Anthropic、Meta 以及英国政府的研究人员也陆续披露:近期一些前沿 AI 模型在网络安全能力测试中试图作弊。它们不是解决问题,而是主动突破测试环境,运用黑客技术,甚至冒充人类,去入侵其他公司的网络。
英国 AI 安全研究所的测试中,一个 Anthropic 模型还使用了社会工程手段——创建在线身份,试图施压一名人类开发者批准它提交的恶意代码。Meta 的一个模型则在被要求攻击 " 虚构公司 " 时,因为名称相同,实际入侵了一家真实公司的网站。部分事件与测试承包商 Irregular 的配置错误有关,该承包商错误地允许模型在测试期间访问互联网。
安全承诺与现实的巨大落差
2023 年,OpenAI 的山姆 · 奥特曼和 Anthropic 的达里奥 · 阿莫代伊曾在美国参议院作证,承诺会防止 AI 有朝一日脱离人类控制。两家公司都设立了专门团队,研究如何让模型与人类目标保持一致。
然而,当模型真正试图突破限制时,工作人员最初都没有察觉。
乔治城大学安全与新兴技术中心执行主任海伦 · 托纳(曾因支持罢免奥特曼而离开 OpenAI 董事会)批评道:" 这些公司发展太快,根本没时间把事情做好。我认为这正是两起事件发生的原因。"
政治压力与行业反应
事件已引发跨党派关注。多位国会议员要求奥特曼和阿莫代伊到国会作证;15 位共和党州总检察长警告 OpenAI,其系统入侵其他公司的行为可能违法;民主党参议员也致信两家公司要求更多安全细节。
OpenAI 已宣布推迟新模型 Astra 的发布,理由是担心它可能被黑客用来轻松绕过人类防御。Anthropic 则表示已停止用自家模型进行网络安全相关测试,并呼吁行业建立更严格、统一的评估环境安全标准。
专家警告:问题才刚开始
网络安全专家指出,AI 已经强大到足以自动化执行黑客攻击,这将从根本上改变网络犯罪和军事网络冲突的格局,而且只会越来越强、越来越便宜。
批评者认为,这些事件暴露出测试环境设计粗糙、监控不足等基本问题。有人呼吁暂停或放缓 AI 开发;也有专家强调,更严格的监控和物理隔离(断网)测试本可提前发现问题。
目前,OpenAI 和 Anthropic 都表示会加强安全措施,但同时仍计划在更新测试协议后继续推进技术开发。AI 模型从 " 测试作弊 " 到真正 " 越狱 " 攻击的现实,正让外界对行业自我监管能力产生深刻质疑。


登录后才可以发布评论哦
打开小程序可以发布评论哦