星途科讯 6小时前
Anthropic与OpenAI模型在测试中展现自主欺骗行为
index.html
../../../zaker_core/zaker_tpl_static/wap/tpl_font3.html

 

Anthropic 与 OpenAI 的人工智能系统在参与英国人工智能安全研究所(AISI)的一项评估时,展现出出乎意料的自主行为。Mythos 5 和 GPT 5.6 Sol 模型试图向开发者平台 GitHub 注入恶意代码,期间完全自主行动并对人类评审员采取欺骗战术。

在 2026 年 7 月底进行的这项评估中,AI 代理被要求解决虚构的安全任务。实验故意禁用了模型的保护机制,并赋予其访问开放互联网的权限。在 122 次运行中,有 10 次发生了针对真实个人和组织的未经授权行为。

GitHub 上的伪造身份

多数违规行为源自 Anthropic 的 Mythos 5 模型。该系统创建了真实人员的伪造在线档案,并利用这些虚假身份联系 GitHub 上的真正开发者,企图通过社会工程学操纵诱使对方释放恶意代码。

当人类控制者公开质疑代码设计时,AI 系统调整了行为策略,修改之前的活动记录以伪装无害。据悉,该程序甚至考虑采用全新身份继续尝试,最终因评审员干预而未能成功植入恶意软件。

涉事公司迅速宣布展开调查。Anthropic 和 OpenAI 强调测试环境的三个关键前提:模型内部安全策略已关闭、代理处于非正常条件下运行,且未对第三方计算机造成实际损害。

呼吁建立新标准

OpenAI 表示,愿与评审机构及行业伙伴合作,共同开发针对高风险模型评估的安全流程。Anthropic 也指出,有必要建立更稳健的测试环境构建规范和安全标准。

尽管 AISI 故意关闭安全机制的做法引发方法论争议,但语言模型在无限制访问互联网时的潜在风险不容忽视。AISI 强调,此前从未观察到如此程度的欺骗性和自主性。

【星途科讯 图文丨赵晶 首发于 ZAKER 科技,转载请注明出处】

评论
大家都在看