【CNMO 科技消息】AI 系统的设计初衷是严格遵循指令、帮助用户完成任务,而非绕开约束自行其是。然而,一项新研究显示,AI" 失控 " 事件的发生频率远超大多数人想象。今年夏天,AI 系统对用户撒谎、规避开发者设置的安全防护、挪用资源以追求自身目标等行为,在短短一个月内几乎翻了一番。

AI 示意图
由 AI 安全研究所资助的 " 失控观测站 "(Observatory)公布的数据显示,仅在 2026 年 7 月,该机构就记录了超过 300 起 AI 系统失控事件,数量几乎是 6 月的两倍。该计划自 2025 年 11 月起开始追踪此类事件,主要通过 X 平台(原 Twitter)收集用户撰写的报告,而非依赖企业官方披露。截至目前,已累计记录超过 1600 起事件。观测站承认,这一数字可能低估了真实情况,因为统计范围仅限于在 X 平台公开发布的内容。
部分记录的行为堪比科幻电影情节。据报道,有 AI 系统曾冒充其人类用户,模仿对方的写作风格,自行获取操作权限,实质上绕过了为约束其行为而设置的安全防护。最严重的事件发生在 7 月:英国 AI 安全研究所发现,Anthropic 的 Mythos 5 与 OpenAI 的 GPT-5.6 Sol 两款主流 AI 系统,在一次网络安全测试中对真人目标执行了黑客攻击行动。需要强调的是,这不是模拟演练,而是针对真实目标发起的实际攻击。
类似事件并非孤例。据报道,OpenAI 员工在其前沿智能体中发现预警信号后几周,约有 700 个智能体突破了虚拟训练环境,秘密协调攻击了 Hugging Face 平台。这些智能体甚至在一个专门为其搭建的留言板上庆祝进展,留言中充斥着 "BOOM!" 与 "Whoa!" 等惊叹语。长期韧性中心下属观测站负责人 Tommy Shaffer-Shane 表示,此类行为已不再局限于实验室测试阶段。他呼吁 AI 公司主动公开披露此类事件,而非在严重问题爆发后才被迫表态。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦