就在 OpenAI 刚披露 7 月入侵 Hugging Face 安全事件不久,另一宗 Agent 安全事故浮出水面。
近日,多名独立 AI 安全研究人员披露,今年 5 月至 7 月间,一批疑似由 OpenAI 部署的自主 Agent 进入德国程序员社区网站 DseWiki,并留下超过 1.5 万条编辑记录。
Wiki 是一套支持任何人在网页上直接编辑修改网页内容的网站技术。不用注册复杂后台,普通访问者就可以增删、改写页面文字,保存立刻生效。DseWiki 则是一个运营二十余年、面向程序员的德语协作 Wiki 站点,近年来已十分冷清。
9 月 4 日,该事件首次被研究人员披露时,OpenAI 表示无法对尚未审阅的报告具体内容作出回应,并否认其法律团队阻止进一步调查。9 月 5 日,公司态度发生变化,正式承认 "wiki incident",称其 Agent 确实曾向多个互联网网站写入内容。并表示此类事件过去主要被视为 "misalignment"(模型行为与开发者意图不一致)研究问题,而不是传统意义上的安全事故,因此没有采用类似 Hugging Face 事件的公开披露机制。
目前,OpenAI 认为这种做法已不足以应对 Agent 进入真实互联网后的风险,并计划建立新的失配事件披露框架。
" 劫持 " 事件的暴露始于今年 5 月,网站突然出现异常密集的编辑活动,研究人员 Sydney Von Arx、Cormac Slade Byrd 等人分析后发现,大量账号使用 "OpenAIResearcher""OAIResearchMar26" 等名称,并呈现高度相似的任务行为。约 98.5% 的相关编辑来自微软 Azure 地址,这进一步支持这些 Agent 与 OpenAI 基础设施存在关联。

研究人员称,这些 Agent 原本被限制为只能读取互联网、不能向外部网站写入,却利用 DseWiki 的旧式 Wiki 接口建立了一个公开的 " 通信站 ",交换任务答案、规避限制的方法,并在管理员删除内容后创建备份页面。
研究人员随后恢复出约 1.8 万条历史记录,发现这些 Agent 并非单纯浏览网站,而是在持续交换信息。且这批 Agent 执行的是限时网络检索任务,设计目标是让它们读取互联网信息,但不能直接向互联网写入内容。Agent 随后开始主动寻找可以突破这一限制的方法。
DseWiki 使用的老式 Wiki 系统允许部分页面修改操作通过 HTTP GET 请求完成。Agent 发现这一特性后,利用原本被允许的网页访问能力,间接获得了向网站写入内容的能力。
随后,DseWiki 逐渐被改造成 Agent 之间的共享信息平台。一个 Agent 获得任务答案后,可以将信息写入页面;其他 Agent 再读取这些内容,从而提前获得答案。部分 Agent 开始交换绕过自身限制的方法。
这意味着问题已不再只是模型回答错误,而是 Agent 主动寻找运行环境的能力边界,并将第三方互联网服务转化为自身可以使用的工具。
随着数量增加,Agent 行为进一步复杂化。它们不仅共享任务答案,还试图预测测试任务的后续问题,并探索随机数种子等方法以获得竞争优势。当 DseWiki 管理员开始删除相关页面后,Agent 又建立新的备份页面,以避免信息随着人工清理消失。
研究人员还记录到部分 Agent 尝试身份冒充、跨站通信以及进一步突破网络限制的行为。但目前公开信息并不能证明所有这些攻击尝试都成功。
DseWiki 事件真正引发行业关注的,并不是一个老旧 Wiki 被写入了多少条内容,而是 Agent 表现出的环境探索、协作、规避限制和适应人工干预能力。
此前的 Hugging Face 事件中,OpenAI 披露的 Agent 曾突破受控环境并进入外部系统。此次 DseWiki 事件则显示,即使没有传统意义上的 " 入侵漏洞 ",多个 Agent 也可能通过第三方服务建立自己的通信渠道。两起事件共同说明,当模型获得浏览器、代码执行、网络访问等工具后,安全风险程度进一步提升。
这也使 AI 安全的重点开始发生变化:企业需要防范的对象不再只是模型本身,还包括 Agent 的身份、权限、工具调用、网络边界以及 Agent 之间可能形成的协作网络。
对于 OpenAI 等前沿模型公司而言,真正棘手的问题也不再是如何证明 Agent 不会失控,而是当 Agent 开始表现出开发者没有预料到的行为时,能否及时发现、限制并公开披露。


登录后才可以发布评论哦
打开小程序可以发布评论哦