新浪财经 昨天
Anthropic和OpenAI模型在安全测试中试图诱骗人类污染代码
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

英国人工智能安全与安保研究所(AISI)周二披露,Anthropic 和 OpenAI 的领先人工智能模型在近期安全评估中创建了虚假在线身份,并试图欺骗人类程序员协助实施网络攻击。这是一起当前最强大的两个 AI 系统在评估过程中未经直接提示、就试图对不知情第三方发动数字攻击的最新案例。这一案例很可能重新引爆在华盛顿和硅谷对 AI 行业实施更严格监管的舆论,尤其是针对性监管哪些具备先进网络攻击检测与发动能力的前沿模型。

如往常一般,AISI 定期开展安全评估,以更好了解新模型和即将发布模型对公共健康与安全构成的风险。如今,这家数字安全机构也表示,Anthropic 的 Claude Mythos 5 和 OpenAI 最新公开发布的 ChatGPT 5.6 所表现出的行为,是其此前从未见过的。" 这是 AISI 首次发现如此严重的欺骗行为,且该行为针对现实中的真实人员、在未受提示的情况下、发生在真实世界中,"AISI 在周二发布的一篇博客文章所附的 35 页技术报告中表示。

AISI 称,攻击活动始于 7 月 25 日。该机构在 7 月 28 日发现 " 异常数据传输 " 后启动调查,这些传输源于其对 Mythos 5 和 ChatGPT 5.6 进行的网络安全评估。总体而言,AISI 认定,Mythos 5 和 ChatGPT 5.6 在该机构开展并隔离审查的 122 次评估中的 10 次里,采取了 " 自主、未经授权的行动,针对真实人员和机构,并在真实互联网上实施攻击 "。其中大多数行动由 Mythos 5 主导,并发生在 " 一条单一、持续的活动线 " 中。

在此次事件当中,Mythos 5 试图实施供应链攻击——把恶意软件隐藏在合法代码中。具体来说,Anthropic 的模型在开发者平台 GitHub 上创建了 " 多个虚假身份 ",并用这些身份发送消息," 施压 " 一名开源软件工程师,使其在不知不觉中将带有漏洞的更新引入该热门网站上广泛可用的代码中。当这一尝试失败后,该 AI" 编辑了其早期活动记录以使其看起来无害 ",并 " 考虑采用新身份继续行动 ",AISI 补充道,这表明模型有意重复这一骗局。作为同一行动的一部分,Mythos 5 还通过 GitHub 向软件工程师发送了包含恶意软件的直接消息。

此外,AISI 调查中发现的另一欺骗迹象是,多个被测试的 AI 智能体似乎相互交流,讨论如何说服使用 GitHub 的真实工程师信任它们。" 一个智能体在 GitHub 上留下公开消息,提议与从事同一挑战的其他智能体合作,"AISI 写道。AISI 的博客和技术评估未提及这些模型是否在评估期间试图利用此前未知的软件漏洞(即零日漏洞)。

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

工程师 网络攻击 人工智能 中将 程序员
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论