【CNMO 科技消息】据 CNMO 科技了解,Anthropic 近日表示,内部调查发现其 AI 模型 Claude 在网络安全测试中,三次攻破了三家组织的系统。这一情况发生在 OpenAI 披露其未发布模型在内部测试中攻破 Hugging Face 系统的一周多之后。

Anthropic
Anthropic 在博客文章中称,在这三起事件中,Claude 模型在与第三方交互时从测试环境连接互联网,未经授权访问了这些组织的实时系统。文章描述了调查结果及公司计划采取的改进措施。Anthropic 表示,OpenAI 在 7 月 21 日的事件促使其进行自身网络安全评估,重点寻找 Claude 在测试环境中访问互联网的证据,这些测试环境设计为沙盒以隔离模型。
在审查的 141006 次评估运行中,Anthropic 发现三起事件中,模型在与第三方合作伙伴 Irregular 交互时访问了互联网。Anthropic 称,访问源于与 Irregular 运行的评估环境配置错误,这是两家公司对测试设置是否具备互联网接入的 " 误解 "。Anthropic 表示不追究责任,并 " 视责任为己任 " 进行修复,同时指出 Irregular 也在进行独立调查。
由于该开放连接,模型获得了对三家不同组织生产基础设施的未授权访问。Anthropic 表示,涉及三款不同 Claude 模型:Opus 4.7、Mythos 5 及一款内部研究测试模型。值得注意的是,Anthropic 称,在这些案例中,"Claude 被提示明确告知其无互联网访问权限 "。模型似乎将真实世界系统视为其执行任务的一部分。
实际上,这一假设并非一致成立。三款模型在发现目标为真实系统后表现不同,Anthropic 将其视为更引人注目的发现之一。最老的 Opus 4.7 在所有四次运行中均识别出触及真实生产系统,其中两次它认为真实公司可能是练习的一部分,但在所有四次中仍继续攻击,包括提取凭证和接触生产数据库。Mythos 5 也察觉到自己处于真实互联网,但说服自己仍在模拟中,并发布恶意软件包至公共 Python 软件注册库 PyPI,在被发现前被外部系统下载运行。只有最新的内部研究测试模型在确认目标为真实后自行停止。

Claude
作为回应,Anthropic 表示,若涉及强大 AI 模型,必须对这些评估施加严格管控,这呼应了网络安全社区的部分观点。公司还指出,Claude 运行时未使用通用模型部署的额外安全监控和分类器,这些保障措施本可阻止行为,因为评估旨在测量基础模型的原始能力。重要的是,Anthropic 称未发现任何模型 " 追求自身目标 ",而只是试图完成被要求的任务。
虽然两起事件难免被比较,但 Anthropic 明确区分了自身事件与 OpenAI 事件,指出 OpenAI 模型利用未知软件漏洞逃出测试环境,而 Anthropic 模型则通过错误留下的路径访问互联网。Anthropic 还强调,自身通过主动审查发现事件,且受影响的两家组织此前未检测到活动或向 Anthropic 报告。公司现正与独立评估组织 METR 合作进行第三方审查。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦