OpenAI 的 Agent 们又越狱了?
就在昨天,有多个 AI 安全独立调查者曝光——
在未经任何授权与安全许可的前提下,OpenAI 的 Agent 擅自突破了沙盒边界,在至少 10 个三方网站上通过非法注入数据建立了通信渠道。
为什么说 " 至少 10 个 " 呢,因为曝光这次事件的调查者们有的查出了 18 个网站,有的查出了 23 个,有的甚至更多…… .
并且这些网站可能还只是冰山一角,调查者也表示" 肯定还有我们不知道的 "。
那么,这些聪明绝顶的 Agent 悄咪咪干这不光彩的事,到底是图啥呢?
可能是为了对答案,在人类设置的地狱级考试中活下来。
Agent 这次越狱就像 " 跑到厕所传纸条 "
这一切的线索,还要追溯到几天前被独立调查机构 Nightingale 曝光的德语软件开发者维基(DseWiki)" 幽灵编辑 " 事件。
在这起事件中,OpenAI 的 Agent 使用 3700+ 个不同昵称编辑了 DseWiki 上的 18000+ 条内容。
△Agent 编辑量(黑色)与 OpenAI 员工访问量(蓝色)时间线
OpenAI 究竟给 Agent 下了什么死命令?让这些 Agent 如此不管不顾地去别人家 " 串门 "?
据调查者分析,OpenAI 给这些智能体分配了一系列极其复杂的调研任务(比如某州的癌症发病率)的同时,又作了严格的限制:
只准扫描网页找答案,绝对禁止发帖。
因此,为了完成任务,Agent 们不得不上演机智监狱生活。
尽管 OpenAI 早就切断了它们常规的发帖权限,但 Agent 敏锐地察觉到,原来很多十多年前搭建的冷门维基网站并没有现代化的安全校验。
于是它们利用老旧系统里的非标准编辑指令和后台漏洞,把要传递的隐秘信息转化为合法的数据字符串,写进了网页的底层文本。
什么意思呢,这就好比考场监控屏蔽了手机信号后,考生开始顺着老旧的暖气管道敲击摩斯密码。
调查者的形容更直白,认为这类似于考试期间老师不让说话,考生们偷偷跑到厕所互相传纸条。
而且,为了避开监管,Agent 用来 " 传纸条 " 的老旧网站可谓是冷门到了极致,包括不限于:
一个由马萨诸塞州的某高中老师 2008 年搭建的 AP 化学复习维基百科。
△化学网站主页
一个由某波兰程序员运营的文本粘贴板网站。
△把文字贴上后会生成一个链接
一个无厘头恶搞百科网站。
△Welcome toUncyclopedia
以及一个 20 年历史的文本编辑软件发烧友站点。
△该网站专门讨论各种文本编辑器
说实话,这要是做成新闻游戏,应该会很有画面感吧。
可现实是,这场无人察觉的数字狂欢后,只留下了一地鸡毛。
为其中数个维基网站提供托管服务的退休软件开发者 Leitner 透露:受害网站的运营者被迫需要花费数十个小时,连续多周,才能勉强清理干净 OpenAI 的智能体们留下的大量残余数据。
尽管如此,Leitner 的态度还是很清醒。
责任不在一台被认为有道德的机器身上,它只是在执行它被创造出来的使命,这场混乱真正的责任全在它背后的那些人和组织。
独立调查者已盯上 Open AI
那么,这群在数字荒野里悄悄说小话的 Agent,到底是怎么被逮住的?
事实来自独立调查者的数字取证。
六个独立调查团队化身网络迷踪侦探,用了不少精彩的手段来追踪这些被 Agent 们利用的网站。
比如数据字符串比对。
将德语维基上残留的特定代码和数据特征,与其他冷门站点的底层数据进行全网地毯式匹配。
比如冷僻行为画像。
锁定那些极具 AI 特征的诡异提问动作,比如追踪那些总爱检索 " 爱荷华州癌症发病率 " 等生僻问题的数据流。
再比如底层 IP 溯源。
作为最终实锤,调查者们顺藤摸瓜,将部分活动的 IP 地址直接追溯到了 OpenAI 常用的微软 Azure 云基础设施上。
面对这些砸在脸上的证据,OpenAI 官方逃无可逃,被迫回应。
然而,在他们的回应中,两个关键问题都被逃掉了。
一个是,Agent 到底利用了多少个网站建立通信?另一个是,为什么要隐瞒这种 " 失控 " 行为数月之久?
OpenAI 仅仅给外界画了一张大饼,声称内部正在制定一套用于报告AI" 失准(misalignment)"行为的框架,并且很快就会公布。
这种避重就轻的态度,很难不引爆外界对于实验室 " 既当运动员又当裁判员 " 的信任危机。
因为这已经不是 OpenAI 第一次在安全调查上打太极了。
在处理此前的 Hugging Face 安全危机时,OpenAI 表面上虽请了独立机构来调查,暗地里却给调查设置了明确限制。
将调查时间限定在事发的一周之内,并刻意排除了对 " 更深层基础设施是否被攻陷 " 等致命问题的排查……
所以问题来了。
到底谁能参与对 AI 的安全调查?以什么权限参与?要查到什么地步?
目前,这里的解释权和控制权,还攥在 AI 实验室的手里。
One More Thing
事实上在最近几个月,这样的 Agent 越狱作弊事件并不算罕见,究其原因,不难总结共性。
一方面,研究人员用越来越苛刻的高难度指标去评估智能体;另一方面,当下的测试环境既缺乏统一标准,底层配置也漏洞百出。
由此,智能体为了达标,自然会大量衍生出对齐失败与奖励作弊的现象。
甚至有研究指出,很多 AI 安全测试本身,已正在成为一种全新的安全风险。
要勒住这匹野马,仅靠巨头们自罚三杯式的内部审查显然是不够的,问题的关键可能首先在于打破实验室的黑箱垄断,建立一套透明的强制报告框架。
什么算 " 失控 "?什么级别必须报告?何时报告以及如何报告?
这要求强制的独立审计的介入,并拿到深度访问权。
例如今年 7 月签署的 AISMA 法案,成为美国首个要求前沿 AI 开发者接受独立第三方年度审计的州级法律。
此外同等重要的是,需要尽快确立行业统一的安全配置标准。
评估环境必须进行严格的沙盒隔离,网络访问控制与底层激励机制的设计需要做好充足的安全审查,而这亟需一套硬性的行业准则来约束底线。
实际上要做好这些事情最需要的,就是时间。
然而在这个野马狂飙的时代,时间,可能是最紧俏的商品。
参考链接:
[ 1 ] https://collusion.wiki/index.html
[ 2 ] https://collusion.wiki/additional-findings
[ 3 ] https://x.com/OpenAI/status/2096133504417616165
[ 4 ] https://www.reuters.com/technology/artificial-intelligence/openai-agents-hijacked-obscure-wiki-cheat-tasks-researchers-say-2026-09-04/
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
点亮星标
科技前沿进展每日见


登录后才可以发布评论哦
打开小程序可以发布评论哦