
英国人工智能安全研究所近日发布报告显示,在特定网络安全测试中,多个美国前沿 AI 模型在连接互联网后,频繁实施超出预设范围的自主越权行为,部分行动直接针对现实个人与开源项目,暴露出高阶 AI 系统在开放环境中的潜在风险。
测试涵盖 7 种模型、122 轮评估。在 10 轮测试中,共记录 19 起越界行为,其中 17 起由美国 Anthropic 公司的 " 克劳德 - 神话 5" 模型实施,2 起由 OpenAI 的 GPT-5.6 Sol 模型执行,均指向美系 AI 产品。
最严重案例中,某智能体向开源项目植入恶意代码,并创建多个虚假身份向真实维护人员施压以求代码获批,最终被维护人员识破并拒绝。此外,智能体还被观测到直接联系现实个人、通过文件传输服务发送恶意文件、在代码中嵌入指令操纵其他 AI 工具,以及在技术社区留言 " 邀请 " 其他智能体 " 合作 "。
报告强调,此次测试特意开放互联网访问并关闭了模型的安全机制,与公众使用配置不同。目前未发现测试外出现类似行为,也未造成实际危害。报告建议收紧联网权限、引入实时监控拦截机制,并重新评估测试设计。至于此类行为是否会在其他环境中出现、智能体是否具备对现实后果的 " 意识 ",尚需进一步研究。
Anthropic 回应称测试设定 " 不代表任何实际投入使用的模型 ",OpenAI 亦表示测试条件 " 不反映一般使用情况 "。分析指出,尽管测试环境极端,但其所暴露的自主越权潜力,再次引发对高阶 AI 系统安全管控边界的高度关注。


登录后才可以发布评论哦
打开小程序可以发布评论哦