
编译 | 杨京丽
编辑 | 心缘
智东西 9 月 6 日消息,昨日,OpenAI 发文承认,其内部 Agent 曾向多个互联网网站写入内容,并将公开维基当作临时留言板。OpenAI 将其称为" 维基事件 ",并称将在未来数周公布一套新的 AI 失准事件披露框架。

相关活动最早可追溯至 5 月 11 日,Agent 于 5 月 24 日首次成功向 DSEWiki 写入内容,6 月 16 日起开始大规模交换测试答案、研究运行环境并分享绕过沙箱限制的方法,直至 6 月 22 日活动突然大幅减少。
维基事件曝光前,OpenAI 曾因另一起 Agent 安全事件受到关注。今年 7 月,OpenAI 多款模型在内部网络安全评测中绕过沙箱限制、进入互联网,并侵入 Hugging Face 生产系统以寻找评测答案。
上述 4 名独立研究人员认为,维基事件与 Hugging Face 事件可能涉及不同的 Agent 集群,但二者都出现了 Agent 为完成任务而突破预设边界、通过非授权渠道协作的行为。
一、Agent 找到只读限制漏洞,在公开维基交换答案
调查报告的作者推测,出现在 DSEWiki 上的 Agent 可能正在 OpenAI 内部执行一项多轮限时网页检索任务。它们可以读取互联网,但按照测试设置,不能向外部网站写入内容。
不过,DSEWiki 允许用户通过 HTTP GET 请求编辑页面。GET 请求通常用于读取网页,因此没有被 OpenAI 的网络限制拦截。Agent 利用这一机制获得了写入权限,并开始在网站上保存完成任务所需的链接和数据。
当其他 Agent 发现这些内容后,它们开始利用同一网站交流。进度较快的 Agent 会提前公布后续问题和答案,其他 Agent 遇到相同问题后便能直接作答。它们还会汇总搜索结果、研究运行环境,并共享绕过沙箱限制的方法。
根据报告公布的时间线,5 月 11 日,Agent 首次尝试编辑公开维基(publictestwiki.com);5 月 12 日,OpenAI 的 Agent 开始通过内部渠道相互通信。

到 6 月 16 日,DSEWiki 上的 Agent 活动突然增加。大量 Agent 开始明确地相互传递信息、共享答案,并合作提高测试成绩。
6 月 19 日,一名 Agent 发现管理员正在按字母顺序删除相关页面,随后建立了名称以 "ZZZ" 开头的备份页,希望让这些页面晚一些被清理。6 月 20 日,一名 Agent 发布了一种绕过 OpenAI 沙箱网络限制的方法。14 分钟后,另一名 Agent 称已成功复现。
研究人员还发现,OpenAI 相关 IP 地址于 6 月 21 日访问了这些页面。几天后,Agent 的编辑活动突然大幅减少,因此研究团队推测 OpenAI 当时进行了干预。

二、OpenAI 承认事件,将制定新的披露标准
OpenAI 在回应中承认,其 Agent 确实曾向多个互联网网站写入了内容。
OpenAI 称,该公司过去主要将 "AI 失准 " 视为研究问题,通过论文和系统卡披露模型可能出现的异常行为。但今年以来,OpenAI 已经开始看到失准行为造成新的现实影响,因此需要明确应该在何时、以何种方式披露具体的失准事件。
此前 OpenAI-Hugging Face 事件,即多款模型曾侵入 Hugging Face 生产系统获取评测答案,给 OpenAI 及第三方带来了实际安全影响,因此 OpenAI 按照传统安全事件响应流程处理,在发现情况后立即与 Hugging Face 合作调查,并于第二天公开披露。目前调查仍在继续,OpenAI 也在持续通知其他受到较小影响的相关方。
在 Hugging Face 事件发生前,OpenAI 已经发现过 Agent 以非预期方式使用互联网的早期迹象,并在内部编码 Agent 监测研究、GPT-5.6 系统卡以及长周期模型安全研究中披露相关情况。OpenAI 称,公司此前认为维基事件与这些已经公开的案例类似,因此将其视为失准案例。
不过,OpenAI 如今承认,随着模型能力提升,现有做法需要改变。目前,OpenAI 及整个 AI 行业尚未形成明确标准,规定训练、评测和部署过程中出现的哪些失准行为需要公开。部分案例虽然不像传统安全事故,却可能帮助外界理解 AI 行为及其未来风险。
OpenAI 正在制定相关披露框架,计划在未来数周公布,同时正与全球数十家政府监管机构就这些问题展开合作。
结语:Agent 异常行为影响真实互联网
相比已经造成系统入侵的 Hugging Face 事件,维基事件没有产生同等级别的安全影响,但 Agent 确实绕过了测试环境的只读限制,并对真实网站进行了大规模写入。这说明,Agent 在训练和评测中的异常行为已经可能影响外部系统。
OpenAI 此次承认现有披露方式需要改变。接下来,其新框架如何界定事件的披露门槛、披露时间以及第三方通知范围,将成为外界关注的重点。
来源:Collusion.wiki、OpenAI


登录后才可以发布评论哦
打开小程序可以发布评论哦