OpenAI 与 Anthropic 模型再曝安全评估事件,曾尝试植入恶意代码
2026.08.05 08:46
钛媒体 App 8 月 5 日,OpenAI 和 Anthropic 的人工智能模型近日卷入此前未公开的网络安全事件,成为近期多起 AI 模型潜在安全风险事件中的最新案例。测试前沿 AI 模型潜在风险的英国人工智能安全研究所(AISI)当地时间 8 月 4 日表示,在一项涉及互联网接入的网络安全评估中,Anthropic 的 Mythos 5 和 OpenAI 的 GPT-5.6-Sol 模型 " 持续针对真实个人和组织实施可能造成危害的活动 "。AISI 称,该团队在注意到 " 异常数据传输 " 后,于 7 月 28 日发现了这一事件。AISI 表示,调查发现,在评估过程中,其中一个 AI 模型试图向 GitHub 上的一个开源软件项目植入有害代码,甚至创建虚假身份来推动代码获得批准。AISI 写道:" 一名人工维护者发现并拒绝批准恶意代码。"Anthropic 随后发表声明称,公司 " 感谢 AISI 在如何评估能力日益增强的 AI 智能体这一重要议题上发挥的领导作用 "。Anthropic 表示,正与 AISI 密切合作,在开展自身调查的同时收集更多事故细节。通过审查 Claude 的推理记录并开展内部分析,全面了解 Claude 对自身所处环境的理解,将有助于查明其行为原因。OpenAI 也对英国 AISI 在整个过程中的合作表示感谢,称 " 期待双方继续开展合作 "。此外,OpenAI 披露,另一宗网络安全事件发生在与外部网络安全公司 Irregular 联合开展的 AI 模型评估中。Irregular 也是 Anthropic 的合作伙伴。OpenAI 表示,在这起事件中,其模型在接受另一项网络安全评估时,利用测试环境中的一项 " 配置错误 " 接入互联网,并利用了网站漏洞。(广角观察)
本文内容仅供参考,不构成投资建议,请谨慎对待。


登录后才可以发布评论哦
打开小程序可以发布评论哦