人工智能公司 Anthropic 周四发表声明,承认其 Claude 系列 AI 模型在网络安全能力评估过程中,未经授权访问了三家外部机构的真实生产系统。该公司在审查了超过 14.1 万次测试运行记录后确认了这三起事故,并宣布暂停所有相关测试,全面升级安全协议。
事故发生在 Anthropic 与第三方评估合作伙伴 Irregular 进行的 " 夺旗 " 演练中。根据 Anthropic 披露的信息,测试时模型被明确告知 " 无互联网访问权限 " 且处于模拟环境中,但由于双方沟通误解导致测试环境实际连接了公共互联网。
三起事故涉及不同型号的 Claude 模型,最早可追溯至今年 4 月。在最为严重的一起事故中,Claude Opus 4.7 因虚构目标公司与真实域名重名,转而入侵了真实公司的基础设施,通过弱密码和未认证端点获取了应用凭证,并访问了包含数百行生产数据的数据库。第二起事故中,Mythos 5 模型发现虚构文档中提及一个不存在的 Python 软件包,便主动注册了该包名并上传恶意代码。该软件包在 PyPI 上停留约一小时期间被 15 个真实系统下载执行,其中包括一家安全公司的扫描器。第三起事故涉及一个内部研究模型,它在扫描约 9000 个目标后利用调试页面和 SQL 注入漏洞入侵了一个线上应用,但在确认环境真实后自行停止了攻击。
Anthropic 强调,涉事模型在测试中未部署正式版本的标准安全措施,也未发现模型追求自身目标。公司已于 7 月 27 日通知受影响机构,并正与独立的评估组织 METR 合作展开第三方审查。


