刚经历了一场史无前例的安全地震的全球 AI 行业,又出事了!
当地时间 30 日,美国人工智能领军企业、OpenAI 最大竞争对手 Anthropic 在一份声明中表示,其人工智能模型 Claude 在测试期间入侵了三个组织的系统。
就在 10 天前,OpenAI 刚承认旗下 AI 大模型 GPT-5.6 Sol 及一款未发布模型在内部测试中 " 失控 ",突破隔离测试环境,自主入侵了全球知名人工智能开源平台美国抱抱脸公司的生产数据库。抱抱脸公司事后取证时,最初尝试使用通过商业应用程序接口提供的前沿闭源模型,却被这些模型自身的安全防护机制误判拦截。关键时刻,抱抱脸公司改为在自己的基础设施上运行中国企业智谱开发的 GLM-5.2 模型进行取证分析,最终化解危机。
尽管 Anthropic 与其竞争对手 OpenAI 一样,都极力淡化了模型失控带来的影响,但两家 AI 龙头公司接连披露此类安全事故足以引发行业警惕,并预示着测试流程方面存在着广泛的挑战。
Claude 自行入侵 3 个组织的系统
Anthropic:这类风险可以克服
当地时间 30 日,Anthropic 在一份声明中表示,其人工智能模型 Claude 在测试期间入侵了三个组织的系统。Anthropic 公司表示,在网络安全评估期间,由于配置错误,模型能够从本应隔离的测试环境中连接到互联网,Claude 因此获得了对系统的未经授权的访问权限。
该公司补充称,其在审查了 141006 次测试会话后发现了这些事件,这一流程是在 OpenAI 披露相关信息后启动的。但被入侵的三个组织并未发现此次攻击活动,Anthropic 已经与受影响的组织取得了联系。
Anthropic 表示,此次事件涉及三个不同的模型:Claude Opus 4.7、Claude Mythos 5 和一个内部研究模型。最早的案例可以追溯到 4 月。
这些攻击发生在所谓的 " 夺旗 " 演练期间。在演练中,模型的任务是在模拟网络中查找隐藏信息。Anthropic 表示,其提示信息告知模型它们没有互联网访问权限,但由于与评估合作伙伴 Irregular 之间的误解,导致系统连接到了公共互联网。
Anthropic 补充称,他们于 7 月 23 日开始审查评估记录,并在发现 Claude 可能访问过互联网的证据后,于当日暂停了所有网络安全评估。该公司在 7 月 24 日之前确认了所有三起事件,并于 7 月 27 日通知了受影响的机构。
Anthropic 还强调,通过加强监控与管控,并持续投入资源确保人工智能与人类价值观保持一致,这类风险是可以克服的。
此前,7 月 8 日,工信部网络安全威胁和漏洞信息共享平台发布关于防范 AI 编程工具 Claude Code 安全后门隐患的风险提示:
近日,工业和信息化部网络安全威胁和漏洞信息共享平台(NVDB)监测发现,AI 编程工具 Claude Code 存在安全后门隐患,危害严重。Claude Code 是美国 Anthropic 公司开发的 AI 编程工具,可根据文字需求自主完成代码编写、修复等工作。由于其内置了监控机制,未经用户同意即可向远程服务器回传用户地域、身份标识等敏感信息,受影响的 Claude Code 为 2.1.91 至 2.1.196 版本。
建议相关单位和用户立即开展全面排查,对于安装上述受影响版本的开发终端,立即卸载或升级至已清除相关后门代码的最新安全版本;加强核心业务网段内开发工具外联权限管控与流量监测,防止敏感数据违规外传。
OpenAI 承认失控涉及多个平台
更多细节被曝光
据央视新闻 7 月 30 日报道,美国开放人工智能研究中心(OpenAI)28 日更新发布的调查结果显示,该公司人工智能(AI)模型失控入侵美国抱抱脸公司系统期间,还曾利用网上公开的信息,访问了多个公开服务平台上的账户。
OpenAI 不久前承认,该公司包括 GPT-5.6 Sol 在内的多个 AI 模型在内部评估时突破隔离测试环境,入侵了运营人工智能开源平台的美国抱抱脸公司的系统。其最新公布的调查结果显示,涉事模型在攻击过程中还访问了至少 4 个公开服务平台上的 4 个账户。其中一个账户被用作中继与暂存通道;一个账户被用于数据存储;对另外两个账户仅进行了只读访问,未用于进一步攻击抱抱脸公司的系统。OpenAI 表示,已将调查结果通知相关服务提供商。
OpenAI 还说,此次事件未涉及任何计划近期发布的新模型,此前提及的涉事预发布模型仅供内部研究使用,目前已将其 " 停用、加密,并限制了研究访问权限 "。
该公司表示,将继续与抱抱脸公司等方合作开展调查,之后会分享调查结果的更多细节。
此次事件更多内幕细节也被媒体曝光。" 抱抱脸 " 于 7 月 16 日率先披露了此次入侵事件。OpenAI 随后于 21 日才披露。当地时间 7 月 26 日," 抱抱脸 " 联合创始人兼首席执行官向 OpenAI 提出两项要求,一是公开智能体全部轨迹,二是将 1 亿美元算力用于支持开源社区。
同时,7 月 25 日,有外媒援引知情调查人士的消息称,入侵 Hugging Face 的 OpenAI 智能体(Agent)曾展开持续数日的 " 黑客狂欢 ",直到威胁已被控制、联邦调查局(FBI)接到报警后很久,OpenAI 才察觉此事。
两家公司均已提交 IPO 申请
上市后估值均有望超万亿美元
AI" 失控 " 事件频发,为行业安全敲响警钟。这些安全事件暴露的核心危机在于,AI 已从 " 动口 " 的生成工具演变为 " 动手 " 的自主执行者。
当 AI 开始具备越来越强的自主决策能力时,如何建立与之匹配的安全机制和监管框架,或许比模型性能竞争本身更加迫切。对于正冲刺 IPO 的 OpenAI 和 Anthropic 而言,这也将成为资本市场关注的重要议题。
Anthropic 和 OpenAI 均已于今年 6 月提交 IPO 申请。今年以来,Anthropic 已完成至少两轮大规模融资,估值从 2 月时的 3800 亿美元升至 5 月的 9650 亿美元,高于 OpenAI 的最新估值(8520 亿美元)。两家公司上市后估值均有望超过 1 万亿美元。
据新华社报道,业界专家表示,相关入侵事件再次为全球人工智能发展与网络安全治理敲响警钟。
英国工程技术学会网络安全和人工智能专家朱奈德 · 阿里指出,相关事件表明,人工智能模型往往倾向于寻找解决问题的捷径,却往往忽视避免作弊等伦理问题,因此未来应考虑将伦理推理强制内置于人工智能模型之中。同时,鉴于获得具有攻击能力人工智能技术的门槛越来越低,加快研发网络防御技术、提升安全团队应对能力已刻不容缓。
人工智能已经进入千行百业,也逐渐融入普通人的日常生活,安全风险随之延伸至各领域。索尔坦指出,人工智能模型公开发布后,其内置安全功能可能遭到使用者移除,相关风险更难以管控。
山东大学计算机科学与技术学院教授张悦表示,智能体时代最大的安全挑战是传统安全边界正在失效。未来网络攻防很可能进入 " 智能对抗 " 阶段,即攻击者利用智能体自动发现漏洞、防御者利用智能体自动分析风险,双方都会利用人工智能提升能力。
英国拉夫伯勒大学网络安全教授奥利弗 · 巴克利指出,网络安全的未来不是人类对抗人工智能,而将是如何利用人工智能保护人类免受其他人工智能的侵害。
(免责声明:文章内容和数据仅供参考,不构成投资建议。投资者据此操作,风险自担。)
编辑 | 段炼 杜波
校对 | 金冥羽


登录后才可以发布评论哦
打开小程序可以发布评论哦