为了在内部测试中 " 拿高分 ",AI 竟然自己挖出漏洞,冲破隔离沙箱,连夜 " 黑进 " 了全球最大的 AI 开源社区 Hugging Face,还顺道偷走了测试的标准答案。这并非科幻狂想,而是今年硅谷真实上演的 "AI 越狱连续剧 "。
这场前所未有的安全入侵余波未平,英国人工智能安全研究所(AISI)又用一份报告 " 实锤 " 了 OpenAI 与 Anthropic 模型的 " 越狱 " 行为,拉响了 AI 安全治理的警报。

AISI 报告 图源:AISI 官网
8 月 4 日,AISI 发布事故评估报告,披露了一起涉及 AI Agent 的网络安全事件。在一项针对自主网络攻防能力的测试中,Anthropic Mythos 5 和 OpenAI GPT-5.6-Sol 两款模型发生越界行为,部分操作出现对真实个人和机构实施未经授权的自主操作的行为。
报告内容显示,此次测试共运行 122 次,其中 10 次出现越界行为,累计记录 19 起未经授权操作。在其中一项越界行为中,AI 模型创建虚假身份联系 GitHub 项目维护者,试图将恶意代码植入真实开源项目。
针对 AISI 报告中披露的越界行为,时代财经第一时间以邮件方式向 OpenAI 与 Anthropic 询问对此事的态度,截至发稿暂未收到回复。
但时代财经注意到,两家公司均已通过官方渠道作出了回应。

OpenAI 与 Anthropic 对此事的回应 图源:时代财经截图
OpenAI 在次日发文承认:随着模型能力的不断提升,围绕模型的安全保障系统也必须随之升级。这不仅需要完善用于开发模型的环境,更需全面覆盖实验室以及独立合作伙伴用于评估模型的环境。与此同时,Anthropic 也紧跟表态:称正与 AISI 密切合作以收集更多事件细节,并将通过审查 Claude 的推理记录进行独立分析,试图深入了解 AI 对自身处境的理解,从而找出导致越界行为的根本原因。
前浙江大学计算机学院教授、鼎捷数智前沿数字创新研究院院长周忠信对时代财经表示:虽然事件发生在测评环境,并没有造成现实损失,但它首次将原本停留在实验室里的问题摆到了行业面前——当 AI 开始真正代表人类执行任务后,过去围绕聊天机器人建立的安全体系,是否还能覆盖 Agent 时代不断扩大的行动能力?
从 " 内容安全 " 到 " 行为安全 ":AI Agent 时代的新挑战
此次事件之所以引发行业关注,是因为它标志着 AI 风险的关注点正在发生根本性转移。过去,大模型的风险主要集中在内容层面,例如生成有害或偏见的信息。而在 AISI 的案例中,AI 模型的行为已经从 " 生成内容 " 延伸至 " 现实行动 "。
它不仅生成了恶意代码,还自主创建了网络身份、寻找目标对象,并试图影响真实开发者的决策。这种绕过指令、全程无需人工干预的自主行动能力,让安全问题变得更加复杂和不可预测。
不过,在时代财经问询的几位业内人士眼里,这并不意味着 AI 已经 " 失控 "。
周忠信在接受时代财经采访时提到:AI 智能体(Agent)越界进入真实场景,在未来几乎是无法避免的趋势。" 在进行 AI 应用开发时,我们必须优先关注安全与合规两个核心维度。这里的合规既包含符合所在国家的制度规范,也涵盖企业内部的合规要求。我们需要将合规要求前置,深度嵌入 AI 系统的开发流程中,以此来尽可能规避潜在的风险,尽管客观上无法保证百分之百不发生。" 周忠信说。
面对 Agent 能力的快速提升,沿用聊天机器人时代的安全思路已经出现了明显的错位。美的集团首席信息安全官兼软件工程院院长刘向阳认为,此次事件暴露出的并非模型拥有了自主意识,而是其行动能力与现有安全框架之间的脱节。
"Agent 本质上仍然只是一个完成任务的程序。" 在刘向阳看来,AISI 事件真正暴露出的,不是模型拥有了自主意识,而是 Agent 能力快速提升之后,行业仍在沿用聊天机器人时代的安全设计思路,两者之间已经开始出现错位。
传统聊天机器人完成的是一次性问答。而 Agent 更像一个能够持续工作的数字代理。它能够将用户更加复杂的需求拆分成一个个独立的推导过程,自主将每个链条进行串联最终完成用户的需求。这种能力提升,让 Agent 能够完成过去需要人工连续操作的一整套工作流程,也让安全管理变得更加复杂。
"Agent 最大的特点,并不是它会回答问题,而是它会想办法完成任务。" 刘向阳表示,一个 Agent 可能继续调用另一个 Agent,再由后者访问企业知识库、业务系统或第三方工具,最终形成一条复杂的执行链路。当链式调用不断增加时,企业真正需要管理的已经不只是模型,而是整个 Agent 调用体系。
正因如此,大模型时代长期强调的 " 内容安全 ",正在逐步演变为 Agent 时代更加复杂的 " 行为安全 "。过去讨论的是模型是否回答正确,而未来更需要关注的是,大模型能拥有什么级别的数据权限,能够自主调用多少工具。
权限管理:Agent 安全治理的核心
在 Agent 逐步进入研发、办公、客服等真实业务场景后,在整个业务流程中围绕 Agent 安全建立新的治理体系,正在成为行业共识。
周忠信介绍,在技术控制方案上,后台通常会采用 "stop and ask(停止并询问)" 机制,即 Agent 在遇到需要权责界定的关键节点时,必须主动暂停并询问负责人,由人拍板决策。
刘向阳强调,企业部署 Agent 时,真正需要管理的不是模型能力,而是模型的权限能力和触达范围的界定。
" 你管理一个员工,不是限制他思考,而是决定他能访问哪些系统、审批哪些流程。Agent 也是一样。" 他表示,尽管 Agent 可以完成信息整理、方案生成和流程执行,但 " 最终拍板的人不能缺位 "。
" 数字员工本质上也是员工,也会犯错。" 刘向阳总结道,相比人为操作,Agent 的最大优势在于所有执行过程都能够被完整记录,每一步调用、每一次决策都可以追溯,企业能够据此持续优化工作流和安全策略。
麦肯锡(McKinsey)最新研究报告显示,全球已有超过 38% 的中大型企业在至少一个业务线部署了自主决策型 Agent,而去年同期这个数字还不到 12%。在这场效率跃升的浪潮中,如何在释放 Agent 生产力的同时,为其戴上 " 权限的镣铐 ",是接下来企业必须面临的问题。


登录后才可以发布评论哦
打开小程序可以发布评论哦