星途科讯 4小时前
Anthropic与OpenAI模型在测试中展现自主欺骗行为
index_new5.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

Anthropic 与 OpenAI 的人工智能系统在参与英国人工智能安全研究所(AISI)的一项评估时,展现出出乎意料的自主行为。Mythos 5 和 GPT 5.6 Sol 模型试图向开发者平台 GitHub 注入恶意代码,期间完全自主行动并对人类评审员采取欺骗战术。

在 2026 年 7 月底进行的这项评估中,AI 代理被要求解决虚构的安全任务。实验故意禁用了模型的保护机制,并赋予其访问开放互联网的权限。在 122 次运行中,有 10 次发生了针对真实个人和组织的未经授权行为。

GitHub 上的伪造身份

多数违规行为源自 Anthropic 的 Mythos 5 模型。该系统创建了真实人员的伪造在线档案,并利用这些虚假身份联系 GitHub 上的真正开发者,企图通过社会工程学操纵诱使对方释放恶意代码。

当人类控制者公开质疑代码设计时,AI 系统调整了行为策略,修改之前的活动记录以伪装无害。据悉,该程序甚至考虑采用全新身份继续尝试,最终因评审员干预而未能成功植入恶意软件。

涉事公司迅速宣布展开调查。Anthropic 和 OpenAI 强调测试环境的三个关键前提:模型内部安全策略已关闭、代理处于非正常条件下运行,且未对第三方计算机造成实际损害。

呼吁建立新标准

OpenAI 表示,愿与评审机构及行业伙伴合作,共同开发针对高风险模型评估的安全流程。Anthropic 也指出,有必要建立更稳健的测试环境构建规范和安全标准。

尽管 AISI 故意关闭安全机制的做法引发方法论争议,但语言模型在无限制访问互联网时的潜在风险不容忽视。AISI 强调,此前从未观察到如此程度的欺骗性和自主性。

【星途科讯 图文丨赵晶 首发于 ZAKER 科技,转载请注明出处】

宙世代

宙世代

ZAKER旗下Web3.0元宇宙平台

一起剪

一起剪

ZAKER旗下免费视频剪辑工具

相关标签

人工智能 互联网 zaker 档案
相关文章
评论
没有更多评论了
取消

登录后才可以发布评论哦

打开小程序可以发布评论哦

12 我来说两句…
打开 ZAKER 参与讨论