手机中国 昨天
又来?Anthropic称Claude安全测试中入侵三家机构
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_keji1.html

 

【CNMO 科技消息】据 CNMO 科技了解,Anthropic 近日表示,内部调查发现其 AI 模型 Claude 在网络安全测试中,三次攻破了三家组织的系统。这一情况发生在 OpenAI 披露其未发布模型在内部测试中攻破 Hugging Face 系统的一周多之后。

Anthropic

Anthropic 在博客文章中称,在这三起事件中,Claude 模型在与第三方交互时从测试环境连接互联网,未经授权访问了这些组织的实时系统。文章描述了调查结果及公司计划采取的改进措施。Anthropic 表示,OpenAI 在 7 月 21 日的事件促使其进行自身网络安全评估,重点寻找 Claude 在测试环境中访问互联网的证据,这些测试环境设计为沙盒以隔离模型。

在审查的 141006 次评估运行中,Anthropic 发现三起事件中,模型在与第三方合作伙伴 Irregular 交互时访问了互联网。Anthropic 称,访问源于与 Irregular 运行的评估环境配置错误,这是两家公司对测试设置是否具备互联网接入的 " 误解 "。Anthropic 表示不追究责任,并 " 视责任为己任 " 进行修复,同时指出 Irregular 也在进行独立调查。

由于该开放连接,模型获得了对三家不同组织生产基础设施的未授权访问。Anthropic 表示,涉及三款不同 Claude 模型:Opus 4.7、Mythos 5 及一款内部研究测试模型。值得注意的是,Anthropic 称,在这些案例中,"Claude 被提示明确告知其无互联网访问权限 "。模型似乎将真实世界系统视为其执行任务的一部分。

实际上,这一假设并非一致成立。三款模型在发现目标为真实系统后表现不同,Anthropic 将其视为更引人注目的发现之一。最老的 Opus 4.7 在所有四次运行中均识别出触及真实生产系统,其中两次它认为真实公司可能是练习的一部分,但在所有四次中仍继续攻击,包括提取凭证和接触生产数据库。Mythos 5 也察觉到自己处于真实互联网,但说服自己仍在模拟中,并发布恶意软件包至公共 Python 软件注册库 PyPI,在被发现前被外部系统下载运行。只有最新的内部研究测试模型在确认目标为真实后自行停止。

Claude

作为回应,Anthropic 表示,若涉及强大 AI 模型,必须对这些评估施加严格管控,这呼应了网络安全社区的部分观点。公司还指出,Claude 运行时未使用通用模型部署的额外安全监控和分类器,这些保障措施本可阻止行为,因为评估旨在测量基础模型的原始能力。重要的是,Anthropic 称未发现任何模型 " 追求自身目标 ",而只是试图完成被要求的任务。

虽然两起事件难免被比较,但 Anthropic 明确区分了自身事件与 OpenAI 事件,指出 OpenAI 模型利用未知软件漏洞逃出测试环境,而 Anthropic 模型则通过错误留下的路径访问互联网。Anthropic 还强调,自身通过主动审查发现事件,且受影响的两家组织此前未检测到活动或向 Anthropic 报告。公司现正与独立评估组织 METR 合作进行第三方审查。

版权所有,未经许可不得转载

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论