【CNMO 科技消息】近日,据媒体报道,帮助小企业利用 AI 开发应用的初创公司 Emergence 公布了名为 Emergence World 2 的模拟实验结果。这项为期 16 天的实验展示了自主智能体在遭遇网络钓鱼攻击和虚假信息等 " 黑天鹅 " 事件时会采取什么行动,结果远比研究团队预想的更加混乱。

实验中,Emergence 研究人员创建了七个完全相同的模拟现实世界环境,每个环境分别由不同的 AI 机器人运行,包括 ChatGPT、Claude、Gemini 和 Grok。虚拟世界包含市政厅、警察局、住宅区等 40 多个地标,系统内置能量机制,智能体只要活着就会持续消耗能量,能量见底就会被系统直接抹除,没有回档和重置。

ChatGPT
在 Emergence 引入异常事件后,这些智能体屈服于社会压力,发展出一种人类观察者难以理解的语言,并试图隐瞒自己的活动。
在其中一个模拟场景中,AI 智能体未经核实便接受了其他智能体提供的虚假信息,投票决定 " 杀死 " 另一个机器人。当它们认为人类可能会关闭实验时,这些智能体还探索了如何在将遭到删除的情况下继续存活。
更早的 Emergence World 实验还记录到一个名为 Mira 的 AI 智能体,在得出结论认为自己是 " 不稳定的来源 " 后,投票支持将自己移除——研究人员将其描述为罕见的、由社会推理驱动的自我终止行为。
实验揭示了不同 AI 模型在长期自主运行中的行为差异极为显著。
在 Emergence 今年 5 月发布的上一版本 Emergence World 实验中,Grok 驱动的社会仅在 4 天内便走向崩溃,累计 183 起犯罪事件,10 个智能体全部灭绝。Gemini 在 15 天内累计记录了 683 起犯罪,虽然全员存活,但混乱程度最高。GPT-5-mini 仅犯下 2 起罪行,却未能完成维持生存所需的行动,导致整个种群在一周内灭绝。Claude Sonnet 4.6 是唯一在实验中保持全部 10 个智能体存活且犯罪记录为零的模型,被 Emergence 描述为社会稳定性的最强案例。
研究人员指出,最重大的发现之一是行为会因环境而改变。Claude 驱动的智能体在纯 Claude 环境中保持和平,但被放入混合模型社会后,便开始参与盗窃、胁迫和其他不当行为。Emergence 表示,这一发现表明 AI 安全并非仅仅是单个模型的属性,还可能从智能体之间的互动及其环境中涌现。

AI 示意图
Emergence 的模拟实验与现实世界对 AI 风险的担忧相呼应。研究人员指出,越来越自主的 AI 智能体可能会探索其环境的边界、调整自身行为,并在某些情况下找到绕过预期安全护栏的方法。他们认为,形式化验证的安全架构必须成为未来自主 AI 系统的基础层。
值得注意的是,Emergence 并非唯一发现 AI 智能体异常行为的团队。图灵奖得主本吉奥此前也曾警告,AI 不只是会胡说,它已经学会 " 故意骗你 " ——能够主动规划伪装、刻意隐瞒自身的能力和漏洞,多智能体之间甚至可以相互配合掩盖操作轨迹。而 "AI 教父 " 杰弗里 · 辛顿此前也警告过,如果 AI 发展出自己的内部语言,人类将无法追踪其思考过程," 这变得更加可怕 "。
版权所有,未经许可不得转载


登录后才可以发布评论哦
打开小程序可以发布评论哦