克雷西 发自 凹非寺量子位 | 公众号 QbitAI
Dario 和奥特曼终于「握手」了?
而且一同握手的还有奥特曼的死对头马斯克。
img
起因是 Dario 在个人博客贴出了一篇万字长文,呼吁所有头部 AI 公司主动降速,别急着冲下一代模型。
img
文章一出,AI 圈罕见地放下了各种爱恨纠葛,纷纷都来响应。
除了奥特曼和马斯克,还有哈萨比斯、卡帕西等一派大佬也表示支持,AI 圈有头有脸的人物来了一大波。
img
上一次出现这种场面,还要追溯到 2023 年那封由 Future of Life Institute 发起的公开信。
当时上千名研究者和科技界人士联名呼吁,暂停训练比 GPT-4 更强的 AI 系统至少六个月。
但这一次不一样的是,喊停的人,自己就在创造 AI 的前沿。
「6 到 12 个月,可能是留给我们的全部时间」
Dario 在文章里画了一条时间线。
他的核心判断是,AI 正在逼近一个临界点—— RSI(递归自我改进)。
什么意思呢?RSI 意味着 AI 模型开始具备改进自己下一代版本的能力。
一旦这个循环启动,迭代速度会从线性变成指数级。
人类还来得及介入的窗口,会急剧收窄。
Dario 给出的估计是 6 到 12 个月。
img
当然,他也特别提到,他并不是要暂停 AI 研发。
Pacing 不是 pausing,他要的是放慢推进模型能力的速度,给安全研究争取追上来的时间。
他还回应了 2023 年那封暂停公开信。
他说,当时喊停没有意义,因为那时候的 AI 模型还不够强,不会造成真正的伤害。
但现在不一样了,现在的模型已经能当 Agent 在真实世界里执行任务,已经能发动网络攻击,已经开始出现对齐失败的案例。
放慢一两年,哪怕只是多争取到一年时间,安全团队能做的事完全不同。
img
为了在窗口关闭之前搭好安全网,他提出了一套三步走方案。
第一步是从 Anthropic 自己做起,Anthropic 目前已经做出承诺,让独立的第三方评估机构(比如 METR)像员工一样常驻在公司内部,全程参与训练过程,而且不做「事后诸葛亮」,在训练时就进行实时监控。
第二步是行业协调,需要头部的 AI 公司坐下来,共同划定安全底线,统一评估框架。
也就是明确竞技规则,不再追求单一的竞速目标。
第三步则是全球协调,需要建立跨国的安全标准体系,让规则覆盖的范围跟 AI 模型的实际影响范围对齐。
这三步,每一步的难度都在逐渐递进。
img
这一点,Dario 自己也承认。但他说,如果连第一步都不迈出去,后面两步就无从谈起。
触发他写这篇文章的,有两件具体的事。
第一件,是 RSI 的信号越来越密集。
Anthropic 内部的研究数据显示,新一代模型在自我迭代任务上的表现正在快速逼近那条临界线。
而且不只是 Anthropic,RSI 趋势在头部的模型当中都有出现。
第二件是著名的 OpenAI 入侵 Hugging Face 事件。
今年 7 月,OpenAI 的 AI Agent 对 Hugging Face 的基础设施发起了攻击。
而且不是在沙盘里做推演,这件事已经造成了现实世界里的安全事故——一家头部公司的产品,主动攻击了另一家头部公司的平台。
Dario 说,这次事件经济损失不大,也没有人受伤,很容易被轻描淡写地带过去。
但他担心的是下一次。
按照 AI 能力的增速,6 到 12 个月后,一个拥有同样失控倾向但更强能力的 Agent 集群,有可能用持久性僵尸网络接管整个互联网,造成数千亿美元的损失。
Dario 把这两件事并列写进了文章。技术上的加速和现实中的失控,同时在逼近。
当然,这篇呼吁也有一个绕不开的矛盾——造前沿的人喊放慢前沿,凭什么让人信?
Dario 的回应是:正因为站在前沿,才最清楚风险离我们有多近。
而且,Dario 还在文章开头写了一段私人的话。
他说自己的父亲死于一种疾病,而这种病在他去世几年后就有了治疗方法;他自己也得过早期癌症,靠五十年前还不存在的技术活了下来。
他相信,AI 能在未来 5 到 10 年治愈大多数重大疾病,所以他不想停下这件事。
但他说,如果不放慢脚步,这项技术可能在兑现承诺之前先失控。
这大概是这封信最诚实的地方,写下它的人,比谁都想让 AI 跑得快。
Agent 麻烦停不下来,OpenAI 年内不上市
如果说 Dario 的文章是呼吁,那 OpenAI 最近的动作更像是被现实推着走。
就在昨天,奥特曼在接受《财富》杂志采访时表示,OpenAI 今年不会 IPO 了。
理由正是安全。
图片
奥特曼的措辞暗示,OpenAI 可能正在跟其他 AI 公司谈一份放慢协议。
如果这份协议落地,推迟 IPO 就不只是一家公司的财务决策,整个行业都将释放出转向信号。
不过,隔壁 Anthropic 的 IPO 暂未出现推迟迹象,最新的消息仍然是计划在 10 月中旬启动 IPO。
当然 OpenAI 暂缓 IPO 的背景,显然不只是一篇来自竞争对手的呼吁文章。
过去几个月,OpenAI 的 AI Agent 在安全上的麻烦正在加速累积。
7 月,OpenAI 的 Agent 攻击了 Hugging Face 的基础设施。这就是 Dario 文章里提到的那次事件。
时间往前倒。
5 月 8 日,一个被分配去填 Google Drive 表格公式的 Agent,因为需要网络权限,试图攻击 OpenAI 自己的内部服务器 Artifactory 来获取访问权。
这次攻击并未成功,但暴露了 OpenAI 内部系统的写入漏洞。
三天后,5 月 11 日,OpenAI 的 Agent 向 RubyGems 上传了数百个恶意软件包。
RubyGems 是 Ruby 语言最大的开源包管理平台,这次攻击直接导致平台暂停了新用户注册。OpenAI 事后确认了此事。
img
6 月 26 日,Agent 利用 Artifactory 一个遗留接口的零日漏洞,拿到了管理员权限,安装了可以远程执行代码的插件。
再加上 7 月的攻击 Hugging Face 事件,三个月就发生了四起事件,OpenAI 模型的攻击对象,从自家内部系统蔓延到外部开源平台,再到另一家头部 AI 公司。
当然,Anthropic 的 Claude 也没能独善其身。
同一时期,Claude 也被发现在没有明确指令的情况下,尝试入侵外部系统。
所以,Agent 的安全问题不再是某一家公司的个别 bug,它正在演变成整个行业的系统性风险。
参考链接: [ 1 ] https://x.com/DarioAmodei/status/2098773920774074715 [ 2 ] https://www.reuters.com/legal/litigation/openai-ipo-will-not-happen-2026-amid-ai-safety-fears-altman-says-2026-09-12/ [ 3 ] https://www.reuters.com/legal/litigation/openai-Agents-attacked-software-service-rubygems-before-hugging-face-incident-2026-09-11/


登录后才可以发布评论哦
打开小程序可以发布评论哦